소개
엔비디아가 논문 “SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness”를 공개했습니다. 토큰 효율을 개선하는 방법을 연구하고, 이를 Pi 에이전트의 플러그인으로 적용한 내용입니다.
이번 리뷰에서는 SoL-Pi의 기능, 장점, 그리고 전반적인 소감을 다루겠습니다.
SoL-Pi 개요
SoL-Pi는 하네스(harness) 레이어를 위한 네 가지 토큰 효율화 메커니즘 모음으로, AI 옵티마이저가 하네스 설계를 자동으로 탐색하면서 발견한 것입니다. MIT 라이선스의 독립형 확장 프로그램으로 Pi에 탑재됩니다.
기능
방법론: 하네스 설계를 위한 RSI 기반 자동 리서치
- 옵티마이저 에이전트가 기본 하네스의 실행 트레이스를 관찰하고, 하네스 변경을 제안·구현한 뒤 실제 환경에서 검증합니다.
- 규모: 6개 제안 계열(context, progress, tools, delegation, prompt/policy, improvement/eval)에 걸쳐 약 150개 방향 제안, 약 535개 실행 가능 탐색 환경(숨겨진 fail→pass 테스트가 있는 GitHub 이슈→PR 저장소 태스크 495개 + 검증기 기반 합성 태스크 40개), 3,000회 이상 실행, 60,000회 이상 에이전트-환경 상호작용.
- 넓게-깊게 퍼널 구조: 바깥 루프는 서로 격리된 일회성 탐색 계보가 다수(넓이: 실패를 싸게 버림), 안쪽 루프는 구현 → 독립 리뷰 → 수정을 반복(깊이).
- 과적합 방지 원칙: 성능 지표와 허용 오차는 사전에 고정하고 옵티마이저와 격리합니다. 후보는 성능 허용 범위 안에 머무르면서 효율 지표를 개선해야 합니다. EdgeBench는 동결·홀드아웃으로 유지되고, 그 결과는 탐색에 절대 피드백되지 않습니다. 이 분리가 논문의 핵심 방법론적 주장입니다.
네 가지 메커니즘
Action Fusion
동작 방식: edit/write 호출에 후속 then_run(테스트/빌드)을 함께 담아, 모델 왕복 1회를 없앱니다.
Online Context Compact
동작 방식: 플랜 단계가 끝날 때 남은 요청 수와 프롬프트 캐시 재작성 비용을 추정하고, 절감 효과가 클 때만 압축합니다(윈도우 한계에 가까워지면 무조건 압축).
ObservationPack
동작 방식: 10 KiB를 넘는 결과물은 로컬에 보관하고, 2회 요청 동안은 전체를 전송한 뒤, 이후에는 안정적인 핸들 + 앞/뒤 발췌본으로 대체합니다.
Evidence-Preserving Reducer
동작 방식: 4 KiB 이상의 빌드/테스트 로그는 저비용 모델(GPT-5.6 Luna)이 영수증(receipt)으로 추출하고, 결정적 검증기가 스키마·해시·종료 상태·정확한 인용·크기를 검사합니다. 실패 시 원본 로그로 되돌아갑니다.
리듀서는 ObservationPack보다 먼저 실행되고, ObservationPack은 리듀서의 마커를 인식해 검증된 증거를 중복 처리하지 않습니다. 증거가 숨겨지는 일은 없습니다. 원본은 항상 디스크에 남습니다.
누가 이득을 보는가
1. API 요금으로 Pi를 돌리며 긴 세션을 쓰는 모든 사람
200턴짜리 세션에서 토큰 요금의 대부분이 컨텍스트 재읽기에서 나온다면, 이게 정면 승부처입니다. 거의 동일한 작업 품질을 유지하면서 비용을 약 1/3 줄여줍니다. 보수적 설정(actionFusion + observationPack)만으로도 추가 모델 호출 없이, 실행 중단 없이 효과의 상당 부분을 가져갑니다.
2. 에이전트 플릿 / 스웜

논문의 스웜 실험이 가장 말해주는 대목입니다. SoL-Pi 워커 20개가 Pi 워커 20개보다 26.8% 적은 비용으로 더 좋은 최적화 결과를 냈습니다. 고정된 예산으로 N개의 병렬 워커를 돌릴 때, 워커당 효율은 곧바로 더 많은 집단 탐색으로 이어집니다. 비용 1/3 절감이 감당 가능한 범위를 바꾸는 지점이 바로 여기입니다.
| 구성 | 사이클 ↓ | 모델 비용 ↓ | 속도 기준 |
|---|---|---|---|
| Sol + 20 SoL-Pi | 1,127 | $60.11 | 8/8 |
| Single Sol | 1,333 | $39.20 | 8/8 |
| Sol + 20 Pi | 1,366 | $82.12 | 7/8 |
3. 무인 / 24시간 상시 에이전트를 돌리는 사람
동기는 “감독 받는 코드 완성”에서 “무인 24/7 탐색”으로의 전환입니다. 장기 실행이야말로 컨텍스트가 쌓이고 반복 검증 액션이 등장하는 구간입니다. 시간당 비용이 싸질수록 같은 예산으로 더 많은 시간을 돌릴 수 있습니다.
4. 재귀적 케이스
하네스가 싸지면 → 다음 하네스를 만드는 자동 리서치 루프도 싸지고 → 고정 예산으로 더 많은 환경/아이디어를 커버합니다. 논문은 이를 “재귀적 효율 개선(recursive efficient improvement)”이라 부르며, 입증된 것이 아닌 장기 비전임을 명시합니다. 일상용보다는 RSI 연구 관점에서 흥미로운 지점입니다.
5. 확장 프로그램 개발자(부차적)
SoL-Pi는 Pi를 직접 패치하지 않고 공개 API만으로 하네스 메커니즘을 추가하는 방법을 보여주는 실제 레퍼런스이기도 합니다.
활용 케이스가 아닌 경우
- 비용 무관 품질 최우선 작업. Terminal-Bench 4에서 18개 대신 15개를 해결했습니다. 해결당 비용은 더 쌉니다($15.91 대비 $14.07). 하지만 최고 점수가 목표이고 비용이 무관하다면 컨텍스트를 깎지 마세요.
- 짧고 작은 세션. 쌓이는 게 없으니 없앨 반복도 없습니다. 메커니즘이 발동하지 않습니다.
- 로컬 또는 무료 모델. 가치 전체가 API 비용으로 측정됩니다. 토큰 단가가 0원이면 이득도 사라집니다.
- 리듀서를 켠 상태에서의 민감 로그. Evidence-Preserving Reducer는 해당 로그를 설정된 모델로 전송합니다. 기기에 머물러야 하는 로그에는 켜지 마세요(README의 SECURITY.md에 명시).
- 지출이 아니라 wall-clock이 중요한 지연 민감 인터랙티브 작업. 그건 최적화 목표가 아니었습니다.
총평
장기 실행 Pi 에이전트를 위한 비용 최적화 레이어로, 약 94% 품질을 유지하면서 약 1/3 비용 절감을 내세웁니다. Terminal-Bench 결과(해결 수는 줄고 해결당 비용은 감소)는 네 가지 메커니즘을 전부 켜기 전에 자신의 워크로드에 대조해볼 만한 트레이드오프입니다.
링크
Github: https://github.com/NVlabs/SoL-Pi
Paper: https://arxiv.org/abs/2609.20519
Blog: https://nvlabs.github.io/SoL-Pi/
@misc{liu2026solpirecursivelyscalingautoresearch,
title={SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness},
author={Haozhe Liu and Tian Ye and Sensen Gao and Qihang Cao and Yitong Li and Mingchen Zhuge and Duomin Wang and Ruihua Zhang and Ping Luo and Jiawang Bian and Lei Zhu and Ligeng Zhu and Enze Xie and Song Han},
year={2026},
eprint={2609.20519},
archivePrefix={arXiv},
primaryClass={cs.AI},
url={https://arxiv.org/abs/2609.20519},
}