LLM-дайджест: 3 сентября 2026
🆕 Новые модели
- Google DeepMind представила Gemini 3.8 Flash и 3.8 Flash Cyber. Компания анонсировала две новые модели семейства Gemini: универсальную Flash и специализированную Flash Cyber.
- Anthropic выпустила Claude Fable и Mythos 5.1. По заявлению Anthropic, Fable 5.1 задаёт новый уровень для программирования, интеллектуальной работы и длительных задач на рассуждение.
📊 Бенчмарки и тесты
- BenchMIRT исследует, что на самом деле измеряют LLM-бенчмарки. Работа AllenAI посвящена интерпретации результатов тестирования языковых моделей и содержанию измеряемых ими показателей.
✨ Новые возможности
- Плагин llm-gemini 0.34 добавил Gemini 3.8 Flash. Новая версия плагина получила поддержку модели
gemini-3.8-flash. - Anthropic опубликовала системные промпты потребительских приложений Claude. Опубликованы промпты Claude.ai и мобильных приложений, но не Claude Cowork и Claude Code; новая версия отдельно ужесточает ограничения на воспроизведение песенных текстов.
📌 Прочее важное
- Исследователи выяснили, когда атрибуты персоны улучшают соответствие LLM мнениям населения. Работа изучает persona prompting для прогнозирования ответов участников опросных панелей с помощью больших языковых моделей.
- Debias-SparseGPT учитывает предвзятость при прореживании LLM. Метод нацелен на сжатие моделей без усиления существующих смещений, которое может возникать при разреживании весов.
- ViSAR предложил адаптивный поиск для ответов по визуальным документам. Подход без дополнительного обучения динамически выбирает число страниц для RAG перед генерацией ответа большой визуально-языковой моделью.
- PragAlign управляет генерацией синтетических диалогов через обратную связь. Фреймворк предназначен для сохранения коммуникативного намерения, эмоционального смысла и естественности диалога в условиях ограниченного доступа к данным.
- LLM объединили с онтологическими ранжировщиками для диагностики редких заболеваний. Исследование сочетает дифференциальные диагнозы языковых моделей с прослеживаемыми сопоставлениями фенотипов, которые дают онтологические ранжировщики.