CoRT: награда для LLM больше не размазывается по всему ответу В обучении с рубриками ответ модели оценивают сразу по н
CoRT: награда для LLM больше не размазывается по всему ответу В обучении с рубриками ответ модели оценивают сразу по нескольким критериям: точность, формат, стиль и полнота. Проблема в том, что методы вроде GRPO обычно превращают эти оценки в одно число. В результате одинаковый сигнал получают все токены ответа — и полезные, и ошибочные. CoRT распределяет награду точнее. Один и тот же ответ оценивается в двух условиях: - с исходным промптом и критериями; - с похожим промптом, но без критериев. Затем метод сравнивает вероятность каждого токена. Если токен стал заметно вероятнее благодаря рубрике, значит он связан с её требованиями и получает больший вес при обновлении модели. CoRT при этом: - не требует отдельной модели для оценки токенов; - не использует ручную разметку; - не меняет итоговую награду за весь ответ; - не запускает дополнительную генерацию; - добавляет только один проход для пересчёта вероятностей. В экспериментах метод в большинстве сравнений обошёл обычный response-level GRPO. Средний прирост составил 4,4 процентного пункта . Идея простая: если критерий выполнили конкретные части ответа, основную награду должны получать именно они. Paper: https://huggingface.co/papers/2607.25659
| Type | Tool |
| Section | Skills & prompts |
| Site language | en |