AI 뉴스로 돌아가기

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

2026.09.0323원문 보기
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps