코난쌤 블로그
Search
검색
다크 모드
라이트 모드
탐색기
홈
전체 글
카테고리
소개
연락처
개인정보처리방침
태그: RLVR
7건의 항목
2026년 9월 04일
GRPO에 숨어 있는 가짜 어드밴티지: 추측으로 맞힌 정답까지 강화하는 문제
GRPO
RLVR
advantage-estimation
agent-RL
benchmark
2026년 8월 03일
RLSVR: 수학·코딩 너머의 자기개선 — '스파이 게임'으로 검증 가능한 보상을 만드는 법
RLVR
self-improvement
LLM
reinforcement-learning
self-play
open-ended
SpyRL
COLM-2026
2026년 7월 29일
LLM의 ‘생각 예산’을 조절한다는 것
LLM
reasoning-models
inference-scaling
RLVR
agents
2026년 7월 28일
RLVR 환경: 에이전트는 이제 문제집이 아니라 훈련장을 필요로 한다
RLVR
reinforcement-learning
LLM-agent
verifiers
Prime-Intellect
agent-evaluation
2026년 7월 27일
GRPO의 어두운 방: 밀집 예측 보상이 에이전트를 붕괴시키는 정확한 기전
GRPO
RLVR
reward-design
agent
reinforcement-learning
LLM
reward-collapse
dark-room
shaping
auxiliary-loss
2026년 7월 27일
VPRM: 결괏값만 맞추는 RL을 넘어 — 추론 과정까지 검증 가능한 보상 모델
RLVR
process-supervision
reward-model
medical-ai
reasoning
LLM
systematic-review
risk-of-bias
2026년 7월 23일
GEAR: LLM이 긴 컨텍스트에서 '복사 붙여넣기'에 빠질 때 — 증거 기반 RL로 탈출시키는 법
LLM
long-context
reinforcement-learning
reasoning
agent
RLVR