LLM-дайджест: 21 июля 2026
🆕 Новые модели
- Google выпустила Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber. Обновлённая линейка быстрых моделей, включая специализированный вариант Cyber.
- NVIDIA представила Cosmos 3 Edge — открытая модель для работы на edge-устройствах, опубликована на Hugging Face.
- Nativ — запуск ИИ-моделей локально на Mac. Prince Canuma (автор MLX-VLM) выпустил инструмент для локального инференса vision-LLM через MLX на Apple Silicon.
✨ Новые возможности
- Fireside chat с командой Claude Code. Саймон Уиллисон опубликовал беседу с Cat Wu и Thariq Shihipar из Anthropic — о Claude Code, Claude Tag, Fable, безопасности кодинг-агентов, evals и дизайне инструментов.
- SWE-Pruner Pro: кодовая LLM сама знает, что обрезать. Исследование показывает, что агент кодирования уже содержит внутренние представления о релевантности контекста — обрезку можно делать без отдельного классификатора.
- «Реверс-инжиниринг теперь дёшев». Уиллисон об эффекте удешевления кода: кодинг-агенты позволяют массово реверсить и автоматизировать домашние устройства.
📊 Бенчмарки и тесты
- Оценка реакции LLM на выражения убеждений (EoB). Новый бенчмарк: когда модель должна принимать контекстные убеждения пользователя, а когда держаться собственных знаний.
- Логические суждения под давлением. Диагностика устойчивости силлогистических рассуждений через обучаемые «мягкие префиксы» при фиксированной модели.
- «У автоматического поиска нет универсально лучшего harness». Анализ OpenEvolve и TTT-Discover: композитные системы автономного поиска сильно зависят от выбора архивов, отбора родителей и бюджета.
📌 Прочее важное
- «Кто боится китайских моделей?» Разбор предложения Бена Томпсона о лицемерии лабораторий, запрещающих дистилляцию своих моделей при обучении на нелицензированных данных.