열 번 중 여섯 번만 끝낸다: 장기 실행 브라우저 에이전트 배포 판단 기준
오픈소스 1위 브라우저 에이전트도 실전형 장기 과제의 65.1%만 완료해, 평균 대신 스텝 구간별 목표치로 배포 여부를 갈라야 합니다.
- BrowserBench(350과제·평균 37.9스텝) 기준 오픈소스 1위 27B 모델도 65.1%, 폐쇄형 최고 GPT-5.5도 67.4%로 32.6%p 미완주
- 온라인 RL(DAO-GRPO) 개선폭은 난이도에 비례 — 어려움 +12.4%p, 50스텝 초과 구간 13.3%→26.7%(+13.4%p), 쉬움 +1.0%p
- 복구 데이터를 커리큘럼 초반에 섞으면 35.1%로 하락 — 순서 준수 시 38.0%, 예산 초과는 실패로 집계하는 규칙 필요

















































































































































