Google разрешила платить мимо кассы Google разрешила платить мимо кассы Актёр клонировал голос, чтобы отбиться от пиратов Актёр клонировал голос, чтобы отбиться от пиратов TSMC переводит ИИ на свет TSMC переводит ИИ на свет YouTube судят за то, что он не отключил рекламу Premium-подписчикам YouTube судят за то, что он не отключил рекламу Premium-подписчикам

Apple заменили оценщиков ИИ-моделей чек-листами

1 мин
Иллюстрация сгенерирована нейросетью GPT-4o

Обычно языковые модели обучают через человеческую недешёвую обратную связь. Тысячи разметчиков ставят лайки и дизлайки ответам ИИ. При этом в Apple справедливо заметили, что люди устают, противоречат друг другу и оценивают тексты субъективно.

Новый метод компании работает иначе. Для каждого запроса модель-учитель автоматически создаёт список конкретных требований. Например, в случае перевода они следующие:
• Переведено на испанский?
• Сохранён формальный тон?
• Учтена терминология?
И так далее. Модель-судья в команде с программой для проверки оценивает ответы по каждому пункту от 0 до 100 баллов. По сути, это развитие предыдущего подхода LLM-as-a-judge.

После замены модель Qwen2.5-7B улучшила результаты на всех тестах. Прирост составил до 8,2% в сложных бенчмарках. Да, проект требует ИИ-судьи и дополнительных вычислений, но при этом снижает требования к дополнительным человеческим ресурсам, ведь LLM оценивает и обучает другая LLM через структурированную самооценку. В итоге скорость обучения растёт. Но нужно понимать, что метод не про безопасность и не заменяет ИИ алайнмент, а просто учит модель лучше следовать инструкциям.

// Илья Власов