개별 규칙은 지키는데 조합은 무너지는 이유

China Mobile 산하 Jiutian Research가 공개한 EnterpriseRAG 벤치마크는 노이즈 섞인 검색 결과(447건) 위에서 13개 LLM의 복합 지시 준수를 측정했습니다. 형식·페르소나·근거 인용 같은 개별 제약 충족률(Loose IAS)은 최고 모델 Qwen3-235B-Thinking이 83.8%까지 올라가지만, 그 제약을 동시에 전부 지켰는지 보는 전체 충족률(Strict IAS)은 26.8%로 뚝 떨어집니다. 57%p 격차입니다. 같은 계열에서 크기를 8B에서 235B로 키워도 응답 충실도는 64.8%에서 67.1%로 거의 제자리인 반면 Strict IAS는 12.3%에서 26.8%로 두 배 넘게 뛰었습니다. 조합적 지시 준수는 사실적 정확도와 별개의 능력이라는 뜻입니다.

지식 공백과 사실 충돌에서 더 벌어지는 격차

검색 결과에 답이 없어 "모른다"고 밝혀야 하는 지식 공백 상황에서, 추론형 중 최고인 Claude-Opus-4.5의 거부 정확도조차 42.7%로 절반을 못 넘겼고 Qwen3-30B-Instruct는 6.6%에 그쳤습니다. 문서끼리 모순되는 사실 충돌을 알아채는 비율은 최고 DeepSeek-R1 44.3%, 최저 GPT-4.1 18.5%였습니다. 더 특이한 건 상관관계입니다. 추론형 모델은 충돌 인지율과 답변 커버리지가 함께 오르는 양의 상관(+0.90)을 보인 반면, 표준형 모델은 답을 많이 낼수록 충돌을 더 놓치는 음의 상관(-0.50)을 보였습니다.

설계에서 운영까지: 프로덕션 RAG 복합 지시 준수 게이트 체크리스트

기획 단계에서는 Loose IAS 대신 Strict IAS를 배포 게이트 지표로 세워야 합니다. 배포 전 Strict IAS 60% 이상, 지식 공백 거부 정확도 70% 이상, 사실 충돌 인지율 50% 이상을 최소선으로 두는 편이 실무에 맞습니다. 개별 제약 충족률만 보고 배포를 결정하면, 형식은 맞는데 근거가 틀린 응답이 그대로 나갈 위험을 놓칩니다.

실패 패턴은 네 가지로 반복됩니다. 형식 검사는 룰 기반으로 하면서 조합 준수 자체는 확인하지 않는 경우, 근거 없는 상황에서도 모델이 답을 지어내는데 낮은 거부 정확도를 그대로 방치하는 경우, 표준형 모델의 충돌 인지-커버리지 음의 상관을 놓쳐 "많이 답할수록 더 틀리는" 구조를 방치하는 경우, 모델 크기만 키우면 조합 준수도 따라 오른다고 가정하는 경우입니다.

복구 분기는 Strict IAS 미달 응답을 자동 반려해 재생성하거나 사람 확인 큐로 넘기는 데서 시작합니다. 거부 정확도가 낮게 측정된 모델은 지식 공백 시나리오에서 별도 모델의 크로스체크를 거치게 하고, 충돌이 감지되면 단정적 답변 대신 상충하는 문서를 나란히 제시합니다.

운영 체크리스트로는 노이즈·지식 공백·사실 충돌 세 시나리오를 합성 데이터로 증강해 회귀셋을 구성합니다. 원 논문에서도 공백·충돌은 실 운영 로그에 각각 5.3%·8.7%만 자연 발생해, 그대로 두면 평가셋에서 과소 표집됩니다. 채점은 형식 검사(규칙 기반)와 행동 프로토콜 검사(LLM 심판)를 병행하고, 사람 표본과의 일치도를 주기적으로 대조해 심판의 신뢰도를 검증합니다.

개선 루프는 배포 후 실사용 로그에서 공백·충돌이 실제로 얼마나 나오는지 추적해 회귀셋 비율을 재조정하는 방식으로 돌립니다. 모델을 교체할 때마다 Strict IAS 델타를 릴리스 게이트에 반영하고, 추론형과 표준형은 충돌 인지-커버리지 상관 부호 자체가 다르므로 모델군별로 별도 임계치를 유지합니다.

핵심만 남긴 적용 포인트

노이즈 섞인 검색 결과 위에서 개별 지시는 84% 가까이 지켜져도 전체 지시 동시 충족은 27% 안팎으로 무너진다는 결과는, 프로덕션 RAG의 배포 게이트를 Loose 지표에서 Strict 지표로 옮겨야 한다는 신호입니다. Strict IAS 60%·거부 정확도 70%·충돌 인지율 50%를 최소선으로 걸고, 공백·충돌을 증강한 회귀셋과 형식+LLM 심판 이중 채점을 배포 파이프라인에 넣어야 개별 제약 통과율에 가려진 조합 실패를 잡아낼 수 있습니다.

참고 링크

EnterpriseRAG: Benchmarking LLM Instruction Adherence and Robustness under Non-Ideal Enterprise Retrieval — arXiv:2608.11584

개별 84%, 전체 27%: 엔터프라이즈 RAG 지시 준수 붕괴 리뷰 — sunny34.com 리서치 리뷰