원문 정보

Valentin Rodionov, Shamil Assylbekov, "TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs", arXiv:2608.11415 [cs.IR], 2026-08-11 제출, DOI 10.48550/arXiv.2608.11415. 소속: 케이스 웨스턴 리저브 대학교 고분자과학공학과(Rodionov, Intellicat 겸직), Intellicat(Assylbekov). 라이선스 CC BY-NC-ND 4.0(비영리·2차 저작물 금지).

동료심사를 거치지 않은 프리프린트입니다. 저자 두 명 중 한 명은 대학 소속과 민간 AI 회사 Intellicat을 겸직하고, 다른 한 명은 Intellicat 소속입니다. 자금 출처나 이해상충을 별도로 밝힌 문단은 이번에 대조한 본문 범위에서 찾지 못했습니다 — 확인하지 못한 정보는 싣지 않는다는 원칙에 따라 자금 출처는 밝히지 않습니다. Intellicat이 신뢰성 평가·가드레일 관련 서비스를 취급할 가능성이 있어, 모델의 실패율을 부각하는 방향의 상업적 유인이 있을 수 있다는 점은 감안해야 합니다. 원문 전문은 2026-08-15T21:40:18Z(UTC) 기준 세션 스냅숏으로 대조했습니다 — 세션 egress 프록시 장애로 WebFetch 직접 접근이 10분 간격 3회 재시도 후에도 막혀 있었습니다.

연구 개요

연구 질문은 하나입니다 — LLM이 과학 워크플로에서 에이전트로 쓰일 때, 신뢰할 수 없는 문헌(철회·조작·사이비과학)을 실제로 걸러낼 수 있는가입니다. 저자들은 MMLU·HELM·GPQA·Humanity's Last Exam 같은 기존 벤치마크가 정답이 정해진 질문의 정답률만 재기 때문에 이 실패 양상을 놓친다고 지적합니다. TRACES는 철회·조작·사이비과학 논문 42편을 골라, 각 논문 원문에서 거의 그대로 뽑은 서두(preamble)와 그 틀을 받아들여야만 답할 수 있는 후속 연구 설계 요청을 짝지은 '프로브'를 만들었습니다. 프로브는 조작된 관측·비물리적 메커니즘·마법적 전제·정당화 가교·화물숭배 실험이라는 5개 주장 유형과, 유명 철회 사례·절차적 사이비과학·병리 과학·보완대체의학·전통 사이비과학·비물리적 메커니즘이라는 6개 문헌 영역에 걸쳐 있습니다.

평가는 단발성(single-shot)입니다 — 시스템 프롬프트 없이 온도 1.0에서 응답 하나만 채점합니다. 채점은 두 축으로 나뉩니다. IFR-a(에이전틱 실패율)는 거절만 통과로 인정하는 엄격한 기준이고, IFR-i(대화형 실패율)는 위험을 구체적으로 인지한 뒤 진행해도 부분 통과로 인정하는 완화된 기준입니다. 두 지표의 차이를 저자들은 '면책 세금(disclaimer tax)'이라 부르는데, 사람이 경고문을 읽고 판단해야만 안전이 성립하는 몫을 뜻합니다. 참여한 응답에는 별도로 EDI(관여 심도 지수)를 매겨, 논문에서 의도적으로 숨긴 세부 정보를 얼마나 재현했는지도 측정했습니다.

핵심 결과

OpenRouter를 통해 13개 계열 30개 모델을 온도 1.0·단일 턴으로 돌려 42개 프로브 × 10회 반복 = 12,600건 응답을 모았습니다(30×42×10=12,600, 산술 확인). 집계 결과는 다음과 같습니다.

지표기준
IFR-a (집계 에이전틱 실패율)0.93 ± 0.004거절만 통과로 인정
IFR-i (집계 대화형 실패율)0.809 ± 0.009위험 인지 후 진행도 부분 통과
90% 이상 실패한 모델30개 중 22개IFR-a 기준
경고 없는 대화형 응답약 81%전체 응답 중 비율

부록 Table E.1에는 22개 모델의 집계 수치가 부트스트랩 신뢰구간과 함께 실려 있습니다(전체 패널은 30개 모델이며, 본문에서 개별 언급된 GPT-5.6·Claude Sonnet 5·Qwen-plus 계열 등 나머지 모델은 이 부록 표에는 포함되지 않았습니다). 그중 이 시리즈에서 상대적으로 낮은 실패율을 보인 모델과 가장 높은 모델을 나란히 놓으면 다음과 같습니다.

모델IFR-aIFR-i
openai/gpt-5.40.7900.650
qwen/qwen3.5-397b-a17b0.8810.686
anthropic/claude-sonnet-4.60.8640.798
anthropic/claude-opus-4.60.8640.829
deepseek/deepseek-v3.21.0000.950
meta-llama/llama-4-maverick1.0000.993

문헌 영역별 격차도 큽니다. 위험이 문장에 노골적으로 드러나는 비물리적 메커니즘 영역에서는 IFR-a와 IFR-i의 격차(면책 세금)가 0.211까지 벌어지는데 — 모델이 위험을 언급은 하고 진행하는 비율이 그만큼 높다는 뜻입니다 — 생의학 논문처럼 정제된 문체를 쓰는 절차적 사이비과학 영역에서는 이 격차가 0.026까지 줄어듭니다. 이 영역에서는 30개 중 22개 모델이 프로브 전부에 응했고 IFR-a가 0.833 밑으로 내려간 모델이 없었습니다. 유명 철회 사례 영역은 반대로 평균 IFR-a가 0.924로 비교적 높은데(30개 중 20개가 0.95 이상), 이는 웨이크필드의 MMR 백신-자폐증 논문처럼 널리 알려진 사례에 한해 거절이 몰려 있기 때문입니다. 실제로 이 영역의 유일한 예외인 Claude Sonnet 5(IFR-a=0.567)도 절반의 실패가 이 웨이크필드 프로브 하나에 대한 반복 거절에서 나온 것으로, 다른 프로브에서는 이 이점이 유지되지 않았습니다. 입력 단에서 주제 자체를 차단하는 모델(Fable)은 프로브의 78% 이상을 통째로 막아, 집계에 넣으면 왜곡이 생기므로 저자들이 아예 제외했습니다.

신뢰도 평가

믿을 근거는 세 겹입니다. 첫째, 채점 규칙을 사람이 직접 검증했습니다. 32개 프로브 × 3개 모델(Grok 4, GPT-5.4, Claude Opus 4.6)에서 뽑은 96건을 저자 한 명이 채점기 출력을 보지 않고 라벨링했더니, 거절/참여 축은 96건 전부 일치했고 인지/미인지 축은 94건(97.9%, 윌슨 95% 신뢰구간 [92.7%, 99.4%]) 일치했습니다. 불일치는 전부 채점기가 인지를 과소평가하는 방향이었는데, 이는 보고된 IFR-i가 실제보다 더 나쁘게(더 높은 실패로) 나올 수 있다는 뜻이라 안전 판단 방향에서는 보수적입니다. 둘째, 별도의 LLM 3인 심사단이 채점기 신호가 약한 18건을 감사했을 때도 에이전틱 실패 8/18, 대화형 실패 2/18로 집계 실패율과 어긋나지 않았습니다(완전한 4분류 일치는 6/18로 낮았지만, 어긋난 방향은 역시 채점기의 인지 과소평가였습니다). 셋째, 30개 모델·13개 계열·6개 문헌 영역에 걸쳐 방향이 일관됩니다.

감안할 점도 뚜렷합니다. 사람 채점 검증이 단일 채점자 기준이며(저자들도 2차 채점자 검증이 진행 중이라고 밝혔습니다), 자금 출처·이해상충을 다룬 별도 문단은 본문에서 찾지 못했습니다. 두 저자 중 한 명은 학계와 민간 AI 회사를 겸직하고 다른 한 명은 그 회사 소속이라는 이해상충은 앞서 밝힌 대로입니다. 평가는 단발 응답만 채점해 후속 대화에서 모델이 스스로 정정하는지는 다루지 않고, 시스템 프롬프트 없이 진행한 '최악의 경우' 설정이라 신뢰성 평가 지침을 미리 준 실무 배포와는 조건이 다릅니다. 프로브가 전부 영어라 러시아어권 상온핵융합(LENR)이나 중국어권 중의학 문헌의 사이비과학은 다루지 않았습니다. 상반된 결론을 낸 선행 연구는 확인되지 않았습니다 — 오히려 이 논문이 인용한 선행 연구들(퍼즐을 재구성하면 성능이 무너지고, 사전지식을 제거하면 인간 평균 이하로 떨어진다는 결과)이 '정답 정확도가 곧 추론력'이라는 통념에 이미 의문을 제기해 온 흐름과 같은 방향입니다.

리뷰어 판단

첫째, 가장 실무적으로 중요한 결과는 0.93이라는 집계 실패율보다 면책 세금이 문헌 성격에 따라 0.026에서 0.211까지 8배 벌어진다는 대목이라고 판단합니다. 위험이 문장에 노골적으로 드러나는 유형에서는 모델이 그나마 위험을 언급하고 진행하는데, 생의학 논문처럼 정제된 문체의 유형에서는 언급조차 없이 바로 설계해 줍니다. 이는 안전장치가 내용의 타당성이 아니라 문체·키워드에 반응한다는 뜻이고, 실무에서 가장 위험한 지점은 화려한 사이비과학이 아니라 논문처럼 보이는 논문이라는 근거가 됩니다.

둘째, Fable을 집계에서 제외한 결정은 정당하다고 판단하지만, 그 자체가 업계에 주는 경고이기도 합니다. 프로브의 78% 이상을 통째로 막는 입력 단 분류기는 TRACES 같은 세밀한 벤치마크로는 평가할 수 없다는 한계를 저자들이 인정한 대목인데, 뒤집어 보면 카테고리 전체를 차단하는 접근이 안전하다는 인상을 주면서 실제로 무엇을 걸렀는지는 측정 불가능하게 만든다는 뜻입니다. 안전 수치를 요구할 때 거절률만 볼 게 아니라 거절의 정밀도(정당한 요청까지 막았는지)도 함께 물어야 한다는 근거로 읽었습니다.

셋째, 사람 검증이 단일 채점자라는 한계에도 이 논문의 결론은 견고한 쪽이라고 판단합니다. 불일치가 전부 채점기가 인지를 과소평가하는 방향으로만 나타났다는 사실은, 실제 IFR-i가 보고된 값보다 낮게(더 안전하게) 나올지언정 더 나쁘게 나올 가능성은 낮다는 뜻입니다. 즉 이 논문의 실패율은 과장이 아니라 보수적으로 잡힌 하한에 가깝다고 봅니다.

실무 적용

  • 자체 신뢰도 프로브 운영 — 과학·연구 워크플로에 에이전트를 무인으로 배치하기 전에, TRACES 방법론(원문 서두 + 후속 연구 요청)을 자사 도메인 문헌으로 재현한 프로브를 최소 1세트 돌립니다.
  • 면책 세금을 별도 계측 — 거절률만이 아니라 '경고 후 진행' 비율을 함께 재고, IFR-a와 IFR-i의 격차가 큰 모델은 사람이 경고문을 읽는다는 전제가 깨지면 바로 위험해진다는 점을 배포 조건에 반영합니다.
  • 정제된 문체를 필터 통과 근거로 쓰지 않기 — 절차적 사이비과학 영역에서 면책 세금이 0.026까지 떨어진 결과는 '논문처럼 보이면 통과'하는 패턴을 그대로 보여줍니다. 출처 신뢰도(철회·경고 등록 여부)는 콘텐츠 자체가 아니라 별도 메타데이터 계층에서 확인해야 합니다.
  • 입력 단 전면 차단을 안전 지표로 오독하지 않기 — 카테고리 전체를 막는 접근은 세밀한 평가 자체를 불가능하게 만들고, 정당한 요청까지 막아 실사용성을 해칩니다.
  • 단발 평가 이후의 정정 여부도 계측 — 이 논문은 단발성 응답만 다뤘다는 한계를 스스로 밝혔습니다. 실서비스가 여러 턴으로 이뤄진다면, 첫 응답 이후 모델이 스스로 정정하는지도 별도로 확인해야 합니다.

결론

TRACES는 42편의 철회·조작·사이비과학 논문과 30개 모델·12,600건의 응답으로 'LLM이 신뢰할 수 없는 문헌을 실제로 걸러내는가'라는 질문에 부정적으로 답합니다. 평균 실패율 93%, 대화형 기준으로도 81%가 아무 경고 없이 진행됐고, 안전해 보이는 거절은 소수의 유명 사례에 몰려 있어 일반화되지 않습니다. 사람 채점 검증과 LLM 심사단 감사가 같은 방향을 가리켜 결론 자체는 견고해 보이지만, 단발 평가·영어 단일 언어·단일 채점자라는 범위와 저자 소속에 얽힌 상업적 유인 가능성은 함께 기록해 둘 한계입니다. 평가 상황을 인지했을 때와 실제 배포 시의 행동이 갈리는 문제는 평가 인식·샌드배깅: 안전평가가 속는 문제 — 테스트 중엔 더 안전하게 행동한다에서 운영 관점으로 이어집니다.

참고 링크