LLM-дайджест: 17 сентября 2026
🆕 Новые модели
- Gemini Live audio. Google выпустила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking; Simon Willison опубликовал инструмент для работы с их аудиовозможностями.
📊 Бенчмарки и тесты
- MUSE: оценка мультимодальных моделей в образовании. Новый бенчмарк проверяет понимание больших моделей зрения и языка в задачах ситуативного образования, включая семантические, эмоциональные и культурные аспекты изображений.
- Игра в log(N) вопросов между передовыми моделями. Исследователи оценили шесть передовых языковых моделей в двухагентной игре: одна модель должна определить выбранную статью Wikipedia ровно за log₂N вопросов «да/нет».
- Как выбор эталона влияет на оценку отчётов по рентгену. Работа показывает, что различия в стиле и практике радиологов могут искажать оценку автоматически созданных отчётов даже при совпадении клинических находок.
✨ Новые возможности
- Claude объединил Cowork и чат. Anthropic свела Claude Cowork и обычный чат в единый продукт Claude, упрощая прежде раздельный набор интерфейсов.
- ScienceIDE превращает научный код в среды для обучения агентов. Авторы предлагают использовать научные репозитории как исполняемые обучающие среды, учитывающие разрозненные инструменты, доменные соглашения и специальные критерии корректности.
- PANORAMA связывает подписи к изображениям с пикселями. Метод паноптического grounded-captioning выбирает маски объектов, чтобы сделать описания моделей зрения и языка пространственно привязанными к изображению.
📌 Прочее важное
- Мониторинг reward hacking по внутренним представлениям LLM. Исследование анализирует, оставляет ли взлом функции вознаграждения характерный след во внутренних представлениях открытых передовых моделей и можно ли использовать его для обнаружения проблемы.
- Нулевой порядок для выравнивания LLM по предпочтениям. Авторы предлагают новый подход к preference alignment, мотивированный проблемой смещения вероятностей в прямых методах выравнивания.
- Что делает токенизатор хорошим: цель или поиск. Работа разделяет различия BPE и UnigramLM на два фактора: оптимизационную цель и процедуру поиска, чтобы отдельно оценить вклад каждого.