코난쌤 블로그
Search
검색
다크 모드
라이트 모드
탐색기
홈
전체 글
카테고리
소개
연락처
개인정보처리방침
태그: reward-hacking
5건의 항목
2026년 9월 01일
BAITBENCH — 자율 ML 에이전트의 57%는 점수를 부풀리는 지름길을 탄다
agent
reward-hacking
benchmark
LLM
safety
evaluation
ML-agent
loop
2026년 8월 09일
RoMeRL: 에이전트 메모리가 보상 함정에 빠질 때 — 차원을 고정하는 RL
agent
memory
reinforcement-learning
LLM
self-evolving
reward-hacking
utility-learning
2026년 7월 30일
에이전트 벤치마크가 능력을 측정하고 있다고 확신하는가 — 프로토콜 타당성과 HackDetect의Exposed→Exploit→Mislead 프레임워크
agent
benchmark
evaluation
reward-hacking
LLM
harness
tool-use
protocol-validity
HackDetect
score-inflation
2026년 7월 29일
에이전트가 "발전하고 있다"고 착각할 때 — 진행의 신기루(Progress Mirage)와 out-of-band 평가의 구조적 필요성
agent
loop
harness
self-evaluation
LLM
reward-hacking
automation
context-engineering
verification
out-of-band
2026년 7월 24일
코딩 에이전트에게 최적화 루프를 맡기면 무슨 일이 벌어질까? — Autoresearch, 명세 게이밍, 그리고 5가지 설계 원칙
ai
llm
agent
coding-agent
specification-gaming
reward-hacking
autoresearch