Anthropic выпустила семейство Claude 5 — claude-fable-5, claude-sonnet-5 и claude-opus-5. Модели думают по умолчанию с регулируемым уровнем усилия (low/medium/high/xhigh/max), устаревшие параметры вроде thinking_budget убраны. Подробнее
Google подвёл итоги июля: три новых Gemini под продакшн-агентов — Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber (выше эффективность токенов, ниже задержка), плюс робо-модель Gemini Robotics ER 2 и музыкальная Lyria 3.5. Подробнее
MiniMax выпустила MiniMax-H3 — «омнимодальную» генеративную систему с открытыми весами; уже появился порт под Apple MLX. Подробнее
Liquid AI представила LFM2.5-2.6B — компактную модель на 2.6B с контекстом 128K для локальных агентов: 220 tok/s на M5 Max, до 2.5 ГБ памяти, обходит модели вчетверо крупнее на instruction-following и tool-use. Подробнее
Появилась поддержка семейства GPT-5.6 — новые модели OpenAI подключены в свежем релизе инструмента LLM. Подробнее
✨ Новые возможности
LLM 0.32 — крупнейший релиз проекта Саймона Уиллисона с момента запуска: видимые трейсы рассуждений, серверные инструменты провайдеров (выполнение кода, веб-поиск), поддержка GPT-5.6 и превращение LLM в агентный фреймворк с паузой на подтверждение человеком и возобновлением из истории. Подробнее
llm-anthropic 0.26 — серверные инструменты Anthropic (WebSearch, WebFetch, CodeExecution, MCP) через флаг -T, а флаг -R скрывает рассуждения из ответа и логов. Подробнее
📊 Бенчмарки и тесты
«Attention is Case-Sensitive» — эмпирическое исследование показало, что регистр букв заметно влияет на внимание LLM: заглавные работают как визуальная «подсветка» внутри строчного текста. arXiv
«Risky Business: Faithfulness-Safety Tension» — работа выявляет конфликт между «верностью» цепочки рассуждений (нужна для мониторинга) и устойчивостью модели к небезопасным подсказкам. arXiv
📌 Прочее важное
«Don't be a meat proxy» — Никлас Грун вводит термин «мясной прокси» для тех, кто вслепую копирует вывод ИИ коллегам: пользуйтесь моделями, но не пересылайте их ответы, не проверив. Подробнее