GAMUT — бенчмарк фактической полноты длинных ответов. Двухуровневые мета-рубрики оценивают не только точность, но и полноту информации в длинных генерациях, где привычный decompose-search-verify молчит. arXiv
MeetingToM — теория разума в мультимодальных LLM. Оценка способности MLLM выводить убеждения и намерения участников многосторонних встреч по речи и поведению. arXiv
✨ Новые возможности
Fireside chat с командой Claude Code (Anthropic). Кэт Ву и Тарик Шихипар на AI Engineer World's Fair обсудили Claude Code, Claude Tag, Fable, безопасность кодинг-агентов, дизайн инструментов и evals.
Inference-time steering для кросс-язычной фактической согласованности. Метод правит смещение внутренних знаний LLM в сторону высокоресурсных языков прямо на инференсе, без дообучения. arXiv
📌 Прочее важное
Copy Less, Ground More. Обучение с подкреплением с учётом доказательств лечит «повторяющееся копирование» — критический сбой моделей в длинноконтекстном рассуждении. arXiv
Agents in the Wild. Обзор перехода агентных LLM-систем из исследовательских прототипов в продакшн-развёртывания — от разработки ПО до научных открытий. arXiv
Prompt Design at Scale. Контролируемое исследование того, как формат инструкций, их количество и длина контекста влияют на следование инструкциям и галлюцинации LLM. arXiv
CircuitKIT — тулкит механистической интерпретируемости. Единый инструмент для обнаружения, оценки и применения «схем» модели: прунинг, редактирование, стиринг, выборочный файнтюнинг. arXiv