AI Hub
전체
AI
Security
Tech
Critical-State RL: 다중 턴 도구 사용에서 학습 가능한 상태 진단
▲
0
arxiv
·
ai
·
2시간 전
핵심요약
• 다중 턴 도구 사용 실패는 단일 모델 호출에 의해 좌우되나, 보상 변화만으로는 학습이 필요한 호출을 알기 어렵다. • Critical-State RL은 작업 정의된 후보 호출과 국소 보상을 활용해 학습 가능한 상태를 식별하고 정책을 최적화한다. • 실험 결과, 진단된 상태에서의 학습이 성능을 크게 개선하며, 다양한 모델과 작업에 적용 가능함을 확인했다.
🔗 원문 보기 →
💬 댓글 (0개)
댓글 작성
← 목록으로