← Новости

LLM-дайджест: 22 июля 2026

llmaimodelsdigest

🆕 Новые модели

📊 Бенчмарки и тесты

  • GAMUT — бенчмарк фактической полноты длинных ответов. Двухуровневые мета-рубрики оценивают не только точность, но и полноту информации в длинных генерациях, где привычный decompose-search-verify молчит. arXiv
  • MeetingToM — теория разума в мультимодальных LLM. Оценка способности MLLM выводить убеждения и намерения участников многосторонних встреч по речи и поведению. arXiv

✨ Новые возможности

  • Fireside chat с командой Claude Code (Anthropic). Кэт Ву и Тарик Шихипар на AI Engineer World's Fair обсудили Claude Code, Claude Tag, Fable, безопасность кодинг-агентов, дизайн инструментов и evals.
  • Inference-time steering для кросс-язычной фактической согласованности. Метод правит смещение внутренних знаний LLM в сторону высокоресурсных языков прямо на инференсе, без дообучения. arXiv

📌 Прочее важное

  • Copy Less, Ground More. Обучение с подкреплением с учётом доказательств лечит «повторяющееся копирование» — критический сбой моделей в длинноконтекстном рассуждении. arXiv
  • Agents in the Wild. Обзор перехода агентных LLM-систем из исследовательских прототипов в продакшн-развёртывания — от разработки ПО до научных открытий. arXiv
  • Prompt Design at Scale. Контролируемое исследование того, как формат инструкций, их количество и длина контекста влияют на следование инструкциям и галлюцинации LLM. arXiv
  • CircuitKIT — тулкит механистической интерпретируемости. Единый инструмент для обнаружения, оценки и применения «схем» модели: прунинг, редактирование, стиринг, выборочный файнтюнинг. arXiv