← Новости

LLM-дайджест: 22 июля 2026

llmaimodelsdigest

🆕 Новые модели

  • Google представила Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber. Новое семейство быстрых моделей, включая специализированную Flash Cyber. Подробнее
  • Nativ — запуск ИИ-моделей локально на Mac. Prince Canuma (автор MLX-VLM) выпустил систему для локального прогона моделей на Apple Silicon через MLX. Подробнее

📊 Бенчмарки и тесты

  • GAMUT — бенчмарк фактической полноты длинных ответов. Двухуровневые мета-рубрики оценивают не только точность, но и полноту информации в длинных генерациях, где привычный decompose-search-verify молчит. arXiv
  • MeetingToM — теория разума в мультимодальных LLM. Оценка способности MLLM выводить убеждения и намерения участников многосторонних встреч по речи и поведению. arXiv

✨ Новые возможности

  • Fireside chat с командой Claude Code (Anthropic). Кэт Ву и Тарик Шихипар на AI Engineer World's Fair обсудили Claude Code, Claude Tag, Fable, безопасность кодинг-агентов, дизайн инструментов и evals. Подробнее
  • Inference-time steering для кросс-язычной фактической согласованности. Метод правит смещение внутренних знаний LLM в сторону высокоресурсных языков прямо на инференсе, без дообучения. arXiv

📌 Прочее важное

  • Copy Less, Ground More. Обучение с подкреплением с учётом доказательств лечит «повторяющееся копирование» — критический сбой моделей в длинноконтекстном рассуждении. arXiv
  • Agents in the Wild. Обзор перехода агентных LLM-систем из исследовательских прототипов в продакшн-развёртывания — от разработки ПО до научных открытий. arXiv
  • Prompt Design at Scale. Контролируемое исследование того, как формат инструкций, их количество и длина контекста влияют на следование инструкциям и галлюцинации LLM. arXiv
  • CircuitKIT — тулкит механистической интерпретируемости. Единый инструмент для обнаружения, оценки и применения «схем» модели: прунинг, редактирование, стиринг, выборочный файнтюнинг. arXiv