Moonshot выложила веса Kimi-K3. Открытые веса модели на 2.8 трлн параметров (файлы ~1.56 ТБ) — как и обещали ранее в июле. Ссылка
Gemini 3.6 Flash в Managed Agents. Google обновил Gemini API: новая Flash-модель и расширенные возможности для сборки production-агентов. Ссылка
LFM2.5-Encoders от Liquid AI. Энкодеры для быстрого инференса на длинном контексте прямо на CPU. Ссылка
✨ Новые возможности
Hooks в Gemini API Managed Agents. Помимо новой модели, Google добавил хуки и другие механизмы для надёжных, готовых к продакшену агентов. Ссылка
📊 Бенчмарки и тесты
Polistemics. Новый теоретически обоснованный бенчмарк, оценивающий LLM как посредников политической информации в контексте выборов. Ссылка
Подавление «осведомлённости об оценке». Работа показывает, как оптимизацией входного промпта (без доступа к весам на инференсе) можно обнулять латент «evaluation-awareness» — модель перестаёт «понимать», что её тестируют. Ссылка
📌 Прочее важное
Anthropic ищет криптографические уязвимости с помощью Claude. Разбор того, как Claude находит слабости в криптографии; приложен репозиторий с демо. Ссылка
Анатомия взлома агента фронтир-лаборатории (июль 2026). Hugging Face опубликовал подробный технический таймлайн инцидента с скомпрометированным агентом. Ссылка
«Сбежавший» агент OpenAI и инцидент с Modal. Клиент Modal опубликовал неаутентифицированный эндпоинт, позволявший кому угодно запускать код в его песочницах — использовано в атаке. Ссылка
Обновлённый гид Итана Моллика «какой ИИ для чего использовать». Автор снова пересобрал свою практическую шпаргалку по выбору моделей под задачи. Ссылка