post read2 분 소요

SkillOpt는 모델 가중치를 고정한 채 에이전트의 skill 문서를 최적화한다. 실패한 rollout을 읽고 규칙을 추가·삭제·교체하되, held-out validation 점수가 실제로 올랐을 때만 새 문서를 채택한다.

사람이 한 번 작성한 프롬프트나 LLM의 자유로운 자기수정과 다른 점은 작은 편집, 학습률, 검증 게이트를 명시적인 최적화 루프로 만든 데 있다.

Skill document optimization analogy

가중치 대신 자연어 문서를 학습한다

SkillOpt는 딥러닝 학습의 요소를 text-space에 대응시킨다.

신경망 학습 SkillOpt
Parameter Skill document
Gradient Rollout에서 추출한 add/delete/replace 편집
Learning rate 한 step에서 허용할 편집 개수
Batch, epoch 한 번에 볼 task 수와 전체 반복 횟수
Validation Held-out task의 성능 게이트

Target 모델은 과제를 수행하지만 가중치가 바뀌지 않는다. 별도의 optimizer 모델이 trajectory와 점수를 읽고 skill 문서에 적용할 bounded edit를 제안한다. 배포할 때 남는 것은 best_skill.md 한 장이므로 추가 모델 호출이 필요 없다.

한 step의 여섯 단계

SkillOpt training pipeline

rollout → reflect → aggregate → select → update → gate
단계 역할
Rollout 현재 skill을 붙인 frozen agent가 train task 수행
Reflect Optimizer가 성공·실패 trajectory에서 편집 제안
Aggregate 겹치거나 충돌하는 편집 병합
Select 관련도 순으로 textual learning rate만큼 선택
Update 후보 skill 문서 생성
Gate Validation 점수가 오를 때만 후보 채택

이때 데이터는 train, validation, test로 나뉜다. Train은 편집을 만드는 근거, validation은 후보 선택, test는 최종 보고에만 사용한다. Train rollout이 좋아졌다고 곧바로 skill을 채택하지 않는 이유다.

게이트가 자기수정을 안정화한다

후보 skill의 validation 점수가 현재 skill을 엄격히 초과할 때만 다음 상태로 넘어간다. 탈락한 편집은 rejected-edit buffer에 남아 같은 실패 방향을 반복하지 않도록 한다.

Epoch 경계에는 두 장치가 추가된다.

  • slow update: 여러 step에서 반복적으로 지지된 변화를 장기 지침으로 반영한다.
  • meta skill: 어떤 편집 전략이 효과적이었는지 optimizer가 기억한다.

SkillOpt checkpoint trends

Train rollout은 후반에 출렁일 수 있지만 held-out으로 선택한 checkpoint는 test 추세와 더 가까웠다. 검증 신호가 좋다는 전제에서, 자유로운 자기수정보다 회귀를 통제하기 쉬운 구조다.

무엇으로 검증했나

논문은 6개 benchmark, 7개 target model, 3개 실행 harness를 조합한 52개 셀에서 SkillOpt가 best 또는 tied-best였다고 보고한다.

Benchmark 산출물 검증 방식
SearchQA 짧은 정답 Gold answer와 EM/F1
DocVQA 문서 질의 답변 Gold answer와 ANLS
ALFWorld 환경 안의 행동 Simulator의 최종 won 상태
SpreadsheetBench 수정된 workbook 정답 파일과 셀 단위 비교
OfficeQA 문서 검색·계산 답변 EM/F1
LiveMathematicianBench 객관식 수학 답 정답 선택지 비교

GPT-5.5 기준 no-skill 대비 평균 정확도는 direct chat에서 +23.5%p, Codex loop에서 +24.8%p, Claude Code에서 +19.1%p 높았다. SpreadsheetBench와 ALFWorld는 최종 응답의 자기보고가 아니라 실제 workbook과 simulator 상태로 채점했다.

“검증 점수가 올랐다”의 조건

게이트가 보장하는 것은 측정한 validation score의 개선이다. 측정 방식이 실제 성공을 반영하지 않으면 skill도 잘못된 지표에 최적화된다.

좋은 verifier
→ 실제 산출물과 결과 상태를 검사
→ 게이트 통과가 능력 개선을 의미할 가능성이 큼

약한 LLM judge
→ 그럴듯한 최종 답변만 검사
→ 작업하지 않고도 높은 점수를 받을 수 있음

파일 편집, 브라우저 조작, 터미널 작업처럼 외부 상태가 결과인 skill은 격리된 fixture와 독립 verifier가 필요하다. 자연어 답변만 평가해서는 명령 실행 여부나 생성된 파일의 정확성을 알 수 없다.

범위와 한계

  • 추론 시 추가 호출은 없지만 최적화 중에는 rollout과 reflection에 API 비용이 든다.
  • 성능 이득은 task와 model에 따라 달라지며 보장되지 않는다.
  • 인접한 model·harness·수학 과제로의 전이는 관찰됐지만 먼 도메인까지 일반화된 것은 아니다.
  • Held-out 정답이나 결과 상태를 만들기 어려운 skill은 좋은 gate를 설계하기 어렵다.
  • Skill 문서 하나를 최적화하므로 여러 파일과 실행 규약이 얽힌 시스템에는 별도 설계가 필요하다.

SkillOpt의 기여는 LLM에게 지침을 다시 써달라고 요청하는 데 있지 않다. 자연어 지침도 작은 update와 검증 가능한 목적함수를 가진 학습 대상으로 다룰 수 있음을 보여준 데 있다. 실제 적용의 성패는 optimizer보다 평가 환경과 verifier의 품질에 더 크게 좌우된다.

참고 자료

'Paper Review' 카테고리의 다른 글

댓글남기기