핵심 요약

  • 논문: Training Proactive and Personalized LLM Agents (arXiv 2511.02208, COLM 2026, v2 기준일 2026-09-11)
  • 결론: 사용자와의 상호작용·적응을 보상에 넣는 다목적 RL로, 36B 모델이 GPT-5 포함 baseline을 평균 +16.72점 앞선다
  • 제안: 사용자 시뮬레이션 환경 UserVille, 다목적 강화학습 프레임워크 PPP
  • 베이스 모델: Seed-OSS-36B-Instruct
  • 핵심 결과: SWE-Bench-Verified (Func-Loc), BrowseComp-Plus에서 평균 +16.72점 개선, GPT-5 포함 baseline 대비 전 차원 우위
항목내용
환경UserVille (LLM 사용자 시뮬레이터 3단계 파이프라인)
최적화 목표Productivity, Proactivity, Personalization
훈련Verl, lr 1e-6, batch 64, group 8, 200 steps
평가SWE-Bench-Verified Func-Loc N=488, BrowseComp-Plus 450/100 분할

문제 정의

기존 에이전트 RL은 태스크 완수 중심이다. 논문은 세 가지 협업 차원을 정의한다.

  1. Productivity: 태스크 성능
  2. Proactivity: 상호작용 품질
  3. Personalization: 사용자 선호 준수

프롬프트 통계 (Appendix B):

데이터셋vague 평균 단어원본 평균 단어
SWE-Bench11.4193.8
BrowseComp17.897.1

UserVille 구조

세 단계로 구성된다.

  1. Prompt Vaguenization: 정밀 프롬프트를 불완전한 버전으로 변환
  2. Preference-Aware User Simulation: 선호 파라미터 기반 LLM 사용자 시뮬레이터
  3. User-Centric Evaluation: 주도성/개인화 피드백 산출

사용자 선호 20종 중 8종은 unseen으로 평가 전용이다. 6종(no_ask, answer_more, only_begin 등)은 규칙 기반 보상, 14종은 LLM-as-a-judge(선호별 루브릭)으로 평가한다.

질문 비용 분류: 저비용/중비용/고비용. 주도성 점수는 세션 user effort가 저비용일 때 1.

Figure 1: 논문 개요

Figure 2: UserVille 파이프라인

PPP 프레임워크

에이전트는 태스크 툴과 사용자 시뮬레이터 양쪽과 상호작용하며 복합 보상을 최대화한다. 보상 구성요소:

보상정의
ProductivitySWE는 F1, 검색은 EM, 풀태스크는 유닛테스트 성공률
Proactivity세션 user effort가 low-effort면 1
Personalization질문 1개 이상 세션의 선호 준수율 평균

구현 상세: 사용자 시뮬레이터 GPT-5-Nano, 최대 출력 32K(Func-Loc)/65K(Full)/41K(Deep-Research), SWE 스캐폴드 OpenHands 기반, 검색 툴 search/open_page, retriever Qwen3-Embed-8B.

실험 결과

RQ1 (상호작용 효과): vague 프롬프트에서 F1 44.11 → 64.50 (상호작용 + PPP 훈련).

Figure 3: SWE-Bench Func-Loc F1

RQ2 (Table 1, vague 프롬프트 + 20 선호 평균):

방법평균ProductivityProactivityPersonalization
GPT-540.4055.8336.6012.96
GPT-5-Mini35.8235.0015.9024.82
GPT-5-Nano30.0924.3011.1016.92
GPT-4.138.8625.0811.3553.04
Seed-OSS-36B45.3238.5943.7069.07
PPP62.0456.2675.5589.26

RQ3 (질문 전략 학습): 질문 수 0.5 → 1.2. 저비용 질문 중심 증가, 중비용 질문은 증가 후 감소, 고비용 질문은 미미. 주도성 보상 제거 시 중·고비용 질문 증가.

Figure 7: 세션당 평균 상호작용

RQ4 (일반화): unseen 선호 8종에서 일관된 개선. 개인화 보상 제거 시 JSON_Format 선호 점수 1.00 → 0.30 붕괴. Func-Loc → SWE-Full 전이 시 성공률 0.29 → 약 0.36, 상호작용 0.10 → 1.8. 정밀 프롬프트에서는 0.558 → 약 0.530으로 소폭 감소 — 상호작용 훈련의 이득은 애매한 지시에서 집중되고 정밀한 지시에서는 미세 비용이 있다.

시뮬레이터 강건성 (Table 3): GPT-5/GPT-5-Mini/GPT-4.1/GPT-4o 시뮬레이터로 평가해도 성능 변동 소폭.

실사용자 연구 (Section 8)

  • 참가자: Prolific, 프로그래밍 경험자 33명, SWE-Bench Verified 첫 100 인스턴스
  • 비교: GPT-5, Seed-36B, PPP-36B 익명 배정
  • 결과: 전체 점수 PPP-36B 3.75, GPT-5 3.79, Seed-36B 3.45. 선호 준수 “Yes” PPP-36B 67.7%로 최고. 문제 해결률 PPP-36B 71.0%, Seed-36B 70.0%, GPT-5 85%. 만족도는 코딩 실력이 아니라 상호작용 기술이 좌우한다는 해석이 가능하다.

부록: 질문 설계 실험

설정질문 수좋은 질문 수비율
페널티/보너스 없음4.652.3951.39%
페널티 추가0.8060.72289.57%
페널티 + 보너스1.101.0292.72%

관련 URL

더 실습해보고 싶은 분들께

자주 묻는 질문

세 가지 평가 지표는 무엇인가?

Productivity(태스크 성공), Proactivity(저비용 질문 기반 세션 비율), Personalization(선호 준수율)이다.

실사용자 연구 규모와 결과는?

33명, PPP-36B 3.75점으로 GPT-5(3.79)와 대등, Seed-36B(3.45)보다 우수.

프론티어 모델의 한계는?

GPT-5의 Personalization 점수가 12.96으로 낮고, GPT-4.1(53.04)보다도 낮다.