IBM Granite 4.2. В блоге Hugging Face опубликован разбор того, как устроены LLM семейства Granite 4.2.
📊 Бенчмарки и тесты
4-битная модель превзошла полноточный оригинал. Авторы Quantization-Aware Healing представили метод восстановления качества после сжатия и заявляют, что полученная 4-битная модель обходит исходную модель полной точности.
Байесовская оценка RAG. Фреймворк RAT совместно моделирует успешность поиска, отказ от ответа и взаимодействие компонентов, чтобы показывать не только итоговую корректность, но и распространение ошибок по RAG-конвейеру.
Детекция машинного текста линейными пробами. Исследование предлагает более эффективный и устойчивый к смене домена способ отличать сгенерированный текст от человеческого, не требующий больших разнообразных обучающих наборов.
✨ Новые возможности
AI-воркфлоу в Gradio. Hugging Face выпустила руководство по сборке, запуску и развёртыванию рабочих процессов ИИ с помощью Gradio.
Рекурсивная память для долгих агентных задач. Архитектура Recuris сочетает рабочую и накопленную опытную память, чтобы отслеживать прогресс и точнее вызывать навыки при длинной истории взаимодействий.
Масштабирование обучения веб-агентов. BrowserForge использует параллельные браузерные песочницы для массового получения качественных траекторий взаимодействия агентов, работающих по отрисованным пикселям.
Проверяемый DeepSearch по научным работам. Crase ограничивает поиск графом цитирования глубиной 1,5 перехода и отсекает связи, чьи утверждения не подтверждаются, делая исследовательский процесс обозримым.
Генерация CAD из неполных описаний. ExpConCAD использует накопленный опыт, чтобы восстанавливать неявные пространственные ограничения и создавать исполняемые CAD-программы по тексту.
📌 Прочее важное
LLM в финансовых исследованиях: найти недостаточно. Работа показывает разрыв между извлечением информации из финансовых документов и её реальным влиянием на выводы модели, предлагая оценивать не только retrieval, но и последующее суждение.