Поиск ChatGPT начал массово использовать оператор site: — по данным Promptwatch, при веб-поиске ChatGPT раскладывает запросы на фан-ауты с ограничением по конкретным доменам; это меняет правила «GEO» (оптимизации под генеративные движки).
ConceptGuard — бенчмарк «контекстно-зависимого разучивания» (unlearning): показывает, что существующие методы удаления знаний из LLM плохо работают, когда forget/retain-наборы пересекаются по смыслу. arXiv
AI4AI-Bench — бенчмарк LLM-агентов в задачах алгоритмического дизайна для рекурсивного самоулучшения: могут ли агенты улучшать сам процесс обучения ИИ. arXiv
Phantom Gains — аудит «самоулучшения» моделей против измеренного нуля: показывает, что часть заявленных приростов LoRA-дообучения — измерительные артефакты, а не реальный рост. arXiv
📌 Прочее важное
Inducing Task Models from Computer-Use Traces — из пассивно записанных скриншотов и действий мыши/клавиатуры выводятся символьные, проверяемые модели рабочих процессов для computer-use агентов. arXiv
Break It Down, Pass It On — исследование переноса навыков между задачами у LLM-агентов: когда выученные навыки переносятся надёжно, а когда вредят агенту. arXiv
Inject, Align, Recover — стадийное пост-обучение для «интернализации» знаний из фиксированного корпуса без ретрива на инференсе (retrieval-free QA). arXiv