← Новости

LLM-дайджест: 21 июля 2026

llmaimodelsdigest

🆕 Новые модели

  • Google выпустила Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber. Обновлённая линейка быстрых моделей, включая специализированный вариант Cyber. Ссылка
  • NVIDIA представила Cosmos 3 Edge — открытая модель для работы на edge-устройствах, опубликована на Hugging Face. Ссылка
  • Nativ — запуск ИИ-моделей локально на Mac. Prince Canuma (автор MLX-VLM) выпустил инструмент для локального инференса vision-LLM через MLX на Apple Silicon. Ссылка

✨ Новые возможности

  • Fireside chat с командой Claude Code. Саймон Уиллисон опубликовал беседу с Cat Wu и Thariq Shihipar из Anthropic — о Claude Code, Claude Tag, Fable, безопасности кодинг-агентов, evals и дизайне инструментов. Ссылка
  • SWE-Pruner Pro: кодовая LLM сама знает, что обрезать. Исследование показывает, что агент кодирования уже содержит внутренние представления о релевантности контекста — обрезку можно делать без отдельного классификатора. Ссылка
  • «Реверс-инжиниринг теперь дёшев». Уиллисон об эффекте удешевления кода: кодинг-агенты позволяют массово реверсить и автоматизировать домашние устройства. Ссылка

📊 Бенчмарки и тесты

  • Оценка реакции LLM на выражения убеждений (EoB). Новый бенчмарк: когда модель должна принимать контекстные убеждения пользователя, а когда держаться собственных знаний. Ссылка
  • Логические суждения под давлением. Диагностика устойчивости силлогистических рассуждений через обучаемые «мягкие префиксы» при фиксированной модели. Ссылка
  • «У автоматического поиска нет универсально лучшего harness». Анализ OpenEvolve и TTT-Discover: композитные системы автономного поиска сильно зависят от выбора архивов, отбора родителей и бюджета. Ссылка

📌 Прочее важное

  • «Кто боится китайских моделей?» Разбор предложения Бена Томпсона о лицемерии лабораторий, запрещающих дистилляцию своих моделей при обучении на нелицензированных данных. Ссылка