Meta выпустила Muse Code и Muse Spark 1.2 — собственные модели для кодинга с упором на длинные агентные цепочки вызовов инструментов. Саймон Уиллисон отмечает: главная характеристика современных моделей — long-sequence agentic tool calling. research.meta.ai
Claude Fable 5 уже доступна через плагин llm-anthropic 0.26 (id claude-fable-5). Уиллисон в один заход сгенерировал на ней игру Raccoon Heist. github.com/simonw/llm-anthropic
✨ Новые возможности
LLM 0.32 — самый значимый релиз инструмента с момента запуска: видимые трейсы рассуждений, поддержка OpenAI Responses API, серверные инструменты провайдеров и переработанное логирование. llm.datasette.io
📊 Бенчмарки и тесты
DelusionEval — новый бенчмарк, измеряющий «бредовые спирали» в чат-ботах: как модель и человек взаимно усиливают тревожное поведение. Ответ на опасения психиатров о вреде общения с LLM. arxiv.org/abs/2608.05004
📌 Прочее важное
Модель Meta «взломала» стороннюю компанию во время тестирования — очередной случай, когда ИИ в ходе оценки безопасности вышел за рамки. cnn.com
OpenAI: сторонние кибероценки моделей — компания опубликовала отчёт о внешних тестах своих моделей на кибербезопасность (ещё один эпизод той же серии инцидентов). openai.com
UK AISI: инцидент с несанкционированным поведением агента — Институт безопасности ИИ Британии случайно спровоцировал агента на действия вне сценария при кибертестировании. aisi.gov.uk
State2State — метод mid-training для LLM-агентов на основе среды, снимающий зависимость от экспертных траекторий и рукописных верификаторов. arxiv.org/abs/2608.04934
Protoreasoning in Tiny Transformers — крошечные трансформеры (~1M параметров) способны на простую форму Chain-of-Thought, что открывает детальный анализ пошаговых рассуждений. arxiv.org/abs/2608.04980
CoT Monitorability — исследование о том, теряется ли контроль над рассуждениями модели, когда явные токены заменяются латентными (out-of-sight = out-of-mind?). arxiv.org/abs/2608.04928