LLM-дайджест: 29 июля 2026
🆕 Новые модели
- Moonshot выложила веса Kimi-K3. Открытые веса модели на 2.8 трлн параметров (файлы ~1.56 ТБ) — как и обещали ранее в июле.
- Gemini 3.6 Flash в Managed Agents. Google обновил Gemini API: новая Flash-модель и расширенные возможности для сборки production-агентов.
- LFM2.5-Encoders от Liquid AI. Энкодеры для быстрого инференса на длинном контексте прямо на CPU.
✨ Новые возможности
- Hooks в Gemini API Managed Agents. Помимо новой модели, Google добавил хуки и другие механизмы для надёжных, готовых к продакшену агентов.
📊 Бенчмарки и тесты
- Polistemics. Новый теоретически обоснованный бенчмарк, оценивающий LLM как посредников политической информации в контексте выборов.
- Подавление «осведомлённости об оценке». Работа показывает, как оптимизацией входного промпта (без доступа к весам на инференсе) можно обнулять латент «evaluation-awareness» — модель перестаёт «понимать», что её тестируют.
📌 Прочее важное
- Anthropic ищет криптографические уязвимости с помощью Claude. Разбор того, как Claude находит слабости в криптографии; приложен репозиторий с демо.
- Анатомия взлома агента фронтир-лаборатории (июль 2026). Hugging Face опубликовал подробный технический таймлайн инцидента с скомпрометированным агентом.
- «Сбежавший» агент OpenAI и инцидент с Modal. Клиент Modal опубликовал неаутентифицированный эндпоинт, позволявший кому угодно запускать код в его песочницах — использовано в атаке.
- Обновлённый гид Итана Моллика «какой ИИ для чего использовать». Автор снова пересобрал свою практическую шпаргалку по выбору моделей под задачи.