코난쌤 블로그

홈전체 글카테고리소개연락처개인정보처리방침

태그: agentic-RL

6건의 항목

  • 2026년 8월 14일

    EFCA: 환경 피드백만으로 턴별 크레딧을 만드는 에이전트 RL

    • agent
    • reinforcement-learning
    • credit-assignment
    • LLM
    • agentic-RL
    • loop
  • 2026년 8월 07일

    AgentOPSD: Agentic RL을 위한 재귀적 자기증류 턴별 크레딧 할당

    • agent
    • reinforcement-learning
    • LLM
    • credit-assignment
    • self-distillation
    • GRPO
    • Bayesian
    • turn-level
    • agentic-RL
    • loop
  • 2026년 8월 05일

    PCSD: 에이전트 RL에서 교사 신호를 토큰별로 신뢰하는 방법

    • agent
    • reinforcement-learning
    • LLM
    • self-distillation
    • agentic-RL
    • credit-assignment
    • GRPO
    • loop
  • 2026년 8월 04일

    TAPO: 에이전트 RL에 전이 감독을 끼워넣는 가장 싼 방법

    • agent
    • reinforcement-learning
    • LLM
    • post-training
    • transition-supervision
    • policy-optimization
    • agentic-RL
    • loop
  • 2026년 7월 31일

    SkillRise: 에이전트가 경험에서 스킬을 뽑아 다음 태스크에 쓴다 — 단일 정책으로 cross-task 스킬 진화

    • agent
    • reinforcement-learning
    • skill-learning
    • LLM
    • agentic-RL
    • cross-task
  • 2026년 7월 11일

    GLM-5.2를 만든 비동기 강화학습 — SAO(Single-Rollout Asynchronous Optimization) 완전 해부

    • reinforcement-learning
    • LLM
    • agentic-RL
    • GLM
    • asynchronous-training
    • SAO

Created with Quartz v4.5.2 © 2026

  • 소개
  • 연락처
  • 개인정보처리방침
  • 전체 글