LLM-дайджест: 2 сентября 2026
🆕 Новые модели
- Anthropic выпустила Claude Fable и Mythos 5.1. Компания позиционирует Fable 5.1 как новый уровень для программирования, интеллектуальной работы и длительных задач по решению проблем.
📊 Бенчмарки и тесты
- BenchMIRT исследует, что на самом деле измеряют LLM-бенчмарки. Новый материал посвящён интерпретации результатов тестирования языковых моделей.
- EDRAC проверяет понимание прочитанного на арабских диалектах. Бенчмарк закрывает дефицит заданий по естественной диалектной речи, поскольку существующие арабские QA-наборы в основном ориентированы на литературный язык или выбор ответа.
- ClinTraceBench оценивает продольное клиническое рассуждение LLM. Набор проверяет, сохраняют ли поиск, структурированные временные шкалы, LLM-сводки и агентная память нужный сигнал из многократных визитов пациента.
- Исследователи проверили перенос навыков от подсказок в генерации кода. Работа на HumanEval+ и MBPP+ выясняет, дают ли подсказки модели новые знания или лишь направляют её к уже доступному решению.
- Декомпозицию задач сравнили в автоматической оценке NLG. Авторы систематически сопоставляют методы LLM-as-a-judge, разбивающие оценивание генерации текста на более простые подзадачи.
✨ Новые возможности
- Gemini получил агентное понимание видео. Google DeepMind представила новый подход к анализу видео с помощью Gemini.
- Google запустила Pics для создания и редактирования изображений в Workspace. Инструмент на базе актуальной модели Nano Banana стал доступен пользователям Google Workspace.
- Hugging Face представила более 200 WebGPU-ядер для локального ИИ. Пакет
@huggingface/kernelsрасширяет возможности запуска ИИ непосредственно через WebGPU. - Codex включает LibreOffice. Саймон Уиллисон обнаружил LibreOffice в составе десктопного приложения OpenAI Codex.