papers/2607.25659

huggingface.co
Visit site

CoRT: награда для LLM больше не размазывается по всему ответу В обучении с рубриками ответ модели оценивают сразу по н

CoRT: награда для LLM больше не размазывается по всему ответу В обучении с рубриками ответ модели оценивают сразу по нескольким критериям: точность, формат, стиль и полнота. Проблема в том, что методы вроде GRPO обычно превращают эти оценки в одно число. В результате одинаковый сигнал получают все токены ответа — и полезные, и ошибочные. CoRT распределяет награду точнее. Один и тот же ответ оценивается в двух условиях: - с исходным промптом и критериями; - с похожим промптом, но без критериев. Затем метод сравнивает вероятность каждого токена. Если токен стал заметно вероятнее благодаря рубрике, значит он связан с её требованиями и получает больший вес при обновлении модели. CoRT при этом: - не требует отдельной модели для оценки токенов; - не использует ручную разметку; - не меняет итоговую награду за весь ответ; - не запускает дополнительную генерацию; - добавляет только один проход для пересчёта вероятностей. В экспериментах метод в большинстве сравнений обошёл обычный response-level GRPO. Средний прирост составил 4,4 процентного пункта . Идея простая: если критерий выполнили конкретные части ответа, основную награду должны получать именно они. Paper: https://huggingface.co/papers/2607.25659

Specs

Type Tool
SectionSkills & prompts
Site languageen

Found in sources

Similar in «Skills & prompts»

Submit a site to the catalog

Just send the link — we will work out the rest.

We will review what you send and add it to the catalog if it fits.

Not sure how to implement it? We can help

Tell us about your task — we will pick the tools and suggest where to start.

0 / 5000
Verification code

Fields marked with an asterisk are required. Your data is used only to reply.