Qwen3.8-Flash-Next. Qwen представила открытую мультимодальную MoE-модель и раннее превью архитектуры Qwen4: при общем размере 125B параметров активируются 6B.
Gemini Omni 1.1 Flash. Google DeepMind анонсировала новую версию Gemini Omni Flash, ориентированную на больший контроль при разработке приложений.
📊 Бенчмарки и тесты
Первые двойные слепые оценки ИИ. Google DeepMind запускает пилотный формат, в котором AI-системы оцениваются двойным слепым методом.
MCR-Bench для ревью кода. Новый бенчмарк переносит оценку LLM-кодревью от статических примеров к реальному итеративному взаимодействию разработчика и ревьюера.
✨ Новые возможности
Gemini в планировании путешествий. AI Mode в Google Search получил три новых сценария: бронирование отелей, отслеживание авиабилетов и просмотр миль и бонусов.
WikiSkill — накопление опыта агентами. Авторы предлагают компилировать опыт AI-агента в постоянную базу знаний, чтобы его переиспользуемые навыки могли развиваться со временем.
CritICL — усиление на этапе инференса. Фреймворк использует ошибки малой языковой модели для weak-to-strong обобщения без многократной генерации и внешней проверки.
TTPO — оптимизация политики во время теста. Метод Test-Time Policy Optimization нацелен на улучшение математического рассуждения без зависимости от заранее известных правильных ответов.
SWE-Prime для coding-агентов. Подход отбирает более качественные траектории решения программных задач, стремясь повысить результат при меньшем объёме обучающих данных.
📌 Прочее важное
Уязвимость Claude Code Opus 5 Auto Mode. Исследование показывает, как prompt injection может обойти защиту автоматического режима coding-агента, на которую Anthropic возлагает значительную часть контроля безопасности.