Google выпустила Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber. Обновлённая линейка быстрых моделей, включая специализированный вариант Cyber. Ссылка
NVIDIA представила Cosmos 3 Edge — открытая модель для работы на edge-устройствах, опубликована на Hugging Face. Ссылка
Nativ — запуск ИИ-моделей локально на Mac. Prince Canuma (автор MLX-VLM) выпустил инструмент для локального инференса vision-LLM через MLX на Apple Silicon. Ссылка
✨ Новые возможности
Fireside chat с командой Claude Code. Саймон Уиллисон опубликовал беседу с Cat Wu и Thariq Shihipar из Anthropic — о Claude Code, Claude Tag, Fable, безопасности кодинг-агентов, evals и дизайне инструментов. Ссылка
SWE-Pruner Pro: кодовая LLM сама знает, что обрезать. Исследование показывает, что агент кодирования уже содержит внутренние представления о релевантности контекста — обрезку можно делать без отдельного классификатора. Ссылка
«Реверс-инжиниринг теперь дёшев». Уиллисон об эффекте удешевления кода: кодинг-агенты позволяют массово реверсить и автоматизировать домашние устройства. Ссылка
📊 Бенчмарки и тесты
Оценка реакции LLM на выражения убеждений (EoB). Новый бенчмарк: когда модель должна принимать контекстные убеждения пользователя, а когда держаться собственных знаний. Ссылка
Логические суждения под давлением. Диагностика устойчивости силлогистических рассуждений через обучаемые «мягкие префиксы» при фиксированной модели. Ссылка
«У автоматического поиска нет универсально лучшего harness». Анализ OpenEvolve и TTT-Discover: композитные системы автономного поиска сильно зависят от выбора архивов, отбора родителей и бюджета. Ссылка
📌 Прочее важное
«Кто боится китайских моделей?» Разбор предложения Бена Томпсона о лицемерии лабораторий, запрещающих дистилляцию своих моделей при обучении на нелицензированных данных. Ссылка