GPT-5.5도 셋에 하나는 못 끝낸다: Wuying-Browser-Agent 장기 실행 브라우저 에이전트 리뷰
가장 강력한 폐쇄형 에이전트도 평균 37.9스텝짜리 실전형 브라우저 과제의 33%를 놓친다는 벤치마크·RL 파이프라인을 원문 대조했습니다.
- Wuying-Browser-Agent-27B가 오픈소스 평균 70.8%(WebVoyager 80.6%·Online-Mind2Web 66.7%·BrowserBench 65.1%)로 1위, Qwen3.8-Max·GPT-5도 앞섬
- 가장 강한 폐쇄형 모델 GPT-5.5도 평균 37.9스텝짜리 BrowserBench에서 32.6%p를 놓쳐 — 짧은 벤치마크에선 드러나지 않는 격차
- 온라인RL(DAO-GRPO) 개선폭은 과제 난이도·길이에 비례 — 어려움 구간 +12.4%p, 50스텝 초과 구간 13.3%→26.7%(+13.4%p)




















