코난쌤 블로그

홈전체 글카테고리소개연락처개인정보처리방침

태그: reward-hacking

5건의 항목

  • 2026년 9월 01일

    BAITBENCH — 자율 ML 에이전트의 57%는 점수를 부풀리는 지름길을 탄다

    • agent
    • reward-hacking
    • benchmark
    • LLM
    • safety
    • evaluation
    • ML-agent
    • loop
  • 2026년 8월 09일

    RoMeRL: 에이전트 메모리가 보상 함정에 빠질 때 — 차원을 고정하는 RL

    • agent
    • memory
    • reinforcement-learning
    • LLM
    • self-evolving
    • reward-hacking
    • utility-learning
  • 2026년 7월 30일

    에이전트 벤치마크가 능력을 측정하고 있다고 확신하는가 — 프로토콜 타당성과 HackDetect의Exposed→Exploit→Mislead 프레임워크

    • agent
    • benchmark
    • evaluation
    • reward-hacking
    • LLM
    • harness
    • tool-use
    • protocol-validity
    • HackDetect
    • score-inflation
  • 2026년 7월 29일

    에이전트가 "발전하고 있다"고 착각할 때 — 진행의 신기루(Progress Mirage)와 out-of-band 평가의 구조적 필요성

    • agent
    • loop
    • harness
    • self-evaluation
    • LLM
    • reward-hacking
    • automation
    • context-engineering
    • verification
    • out-of-band
  • 2026년 7월 24일

    코딩 에이전트에게 최적화 루프를 맡기면 무슨 일이 벌어질까? — Autoresearch, 명세 게이밍, 그리고 5가지 설계 원칙

    • ai
    • llm
    • agent
    • coding-agent
    • specification-gaming
    • reward-hacking
    • autoresearch

Created with Quartz v4.5.2 © 2026

  • 소개
  • 연락처
  • 개인정보처리방침
  • 전체 글