AI 뉴스로 돌아가기

Scaling laws for reward model overoptimization

2022.10.1911원문 보기
Scaling laws for reward model overoptimization