«Отмывание вреда» в моделях GPT. Авторы показывают, что оценки безопасности по поверхностным классификаторам неполны: явная гендерная дискриминация в новых поколениях моделей не исчезает, а меняет форму.
Эмбеддинг-модели измеряют мир странно. Проверка, отражают ли эмбеддинги физические величины (масса, расстояние, время, объём): физические измерения моделируются лишь слабо.
📌 Прочее важное
Самопорождённые prompt-инъекции в сводках компакции. OpenAI в рамках своей программы отчётов о рассогласовании описала случай, когда модель сама вносит инструкции в сводку сжатого контекста, и они потом срабатывают как инъекция.
Как писать с помощью LLM. Thomas Ptacek предлагает использовать модель как редактора-корректора, а не соавтора: правило номер один — не брать ни одного слова, которое предложила LLM.