Google представила Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber. Новое семейство быстрых моделей, включая специализированную Flash Cyber. Подробнее
Nativ — запуск ИИ-моделей локально на Mac. Prince Canuma (автор MLX-VLM) выпустил систему для локального прогона моделей на Apple Silicon через MLX. Подробнее
📊 Бенчмарки и тесты
GAMUT — бенчмарк фактической полноты длинных ответов. Двухуровневые мета-рубрики оценивают не только точность, но и полноту информации в длинных генерациях, где привычный decompose-search-verify молчит. arXiv
MeetingToM — теория разума в мультимодальных LLM. Оценка способности MLLM выводить убеждения и намерения участников многосторонних встреч по речи и поведению. arXiv
✨ Новые возможности
Fireside chat с командой Claude Code (Anthropic). Кэт Ву и Тарик Шихипар на AI Engineer World's Fair обсудили Claude Code, Claude Tag, Fable, безопасность кодинг-агентов, дизайн инструментов и evals. Подробнее
Inference-time steering для кросс-язычной фактической согласованности. Метод правит смещение внутренних знаний LLM в сторону высокоресурсных языков прямо на инференсе, без дообучения. arXiv
📌 Прочее важное
Copy Less, Ground More. Обучение с подкреплением с учётом доказательств лечит «повторяющееся копирование» — критический сбой моделей в длинноконтекстном рассуждении. arXiv
Agents in the Wild. Обзор перехода агентных LLM-систем из исследовательских прототипов в продакшн-развёртывания — от разработки ПО до научных открытий. arXiv
Prompt Design at Scale. Контролируемое исследование того, как формат инструкций, их количество и длина контекста влияют на следование инструкциям и галлюцинации LLM. arXiv
CircuitKIT — тулкит механистической интерпретируемости. Единый инструмент для обнаружения, оценки и применения «схем» модели: прунинг, редактирование, стиринг, выборочный файнтюнинг. arXiv