AI에게 규칙을 많이 줄수록 왜 오류가 더 늘어날까
AI에게 작성해 주는 규칙이 상세해질수록 오히려 규칙을 위반할 가능성이 커집니다. 이것이 실증 데이터가 보여주는 냉혹한 현실입니다.
36.2%. 현재 세계 최고 수준의 AI 모델이 124페이지 분량의 회사 규정집을 읽은 후 모든 규칙을 엄격하게 준수한 성공률입니다.
쉽게 말해, 60%가 넘는 확률로 AI가 실수나 오류를 저지른다는 뜻입니다.
더 놀라운 것은 이 성적의 주인이 2026년 7월에 막 출시된 최첨단 모델 Claude Fable 5라는 점입니다. 다른 주요 모델들(GPT-5.5, Gemini 3.5, DeepSeek V4)의 성적은 더 참담하여, 엄격 통과율이 대체로 10%~22% 사이를 오갔습니다.
이 연구는 소규모 실험실 테스트에 그치지 않습니다. Surge AI 연구팀이 발표한 논문 HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following (COLM 2026 Workshop on Agent Behavior 채택)은 재무, 의료 청구, 보험, 물류, 인사 등 5개 분야에 걸쳐 65개의 실제 기업 환경을 가상으로 구축했습니다. 그리고 분야별 전문가들이 20페이지에서 124페이지에 이르는 표준 작업 절차서(SOP) 매뉴얼 10세트를 작성했습니다.
연구팀의 실험 설계는 매우 정교했습니다. AI 에이전트를 실제 문서, 이메일, Slack 대화, 일정, 티켓 시스템, 전자상거래 백엔드가 갖춰진 ‘미니 회사’에 투입했습니다. 에이전트의 일과 업무는 “회사 매뉴얼에 따라 오늘 할 일을 처리하는 것”이었습니다. 들으시기에는 간단해 보이지 않으신가요?
결과는 참패였습니다.

그림 1: HANDBOOK.md에서 주요 AI 모델의 엄격 통과율. 출처: arXiv:2607.25398. 가장 우수한 모델조차 과제의 36.2%만 통과했습니다.
직관에 반하는 진실: 규칙이 많을수록 위반도 늘어난다
여기에는 깊은 통념 파괴적 현상이 존재합니다.
사람들의 일반적인 직관은 이러합니다. AI가 잘못된 행동을 할까 봐 걱정된다면 규칙을 더 상세하게 쓰면 된다고 생각합니다. 경계 조건을 명확히 하고, 예외 처리 절차를 빠짐없이 기재하면 AI가 무엇을 할 수 있고 무엇을 하면 안 되는지 분명히 알아서 행동을 통제할 수 있다고 믿습니다.
하지만 이 직관은 AI 앞에서 완전히 무너집니다.
논문의 실험은 모순적인 결과를 보여줍니다. 규정 문서를 20페이지에서 124페이지로 늘렸을 때, AI가 규칙을 위반하는 빈도가 오히려 상승했습니다. 문서가 길어질수록 에이전트는 핵심 조항을 누락하거나 우선순위를 혼동하고, 심지어 특정 규칙의 존재 자체를 잊어버렸습니다.
이러한 현상의 원인은 현재 대형 언어 모델(LLM)이 초장문 컨텍스트를 처리할 때 지닌 구조적 결함 때문입니다.
규칙이 많아질수록 AI는 왜 실수를 저지를까?
이 현상 뒤에 숨겨진 4가지 주요 메커니즘을 아래와 같이 설명합니다.
메카니즘 1: 긴 컨텍스트 = 주의력 희석
인턴에게 124페이지짜리 직원 매뉴얼을 읽게 한 뒤 곧바로 업무를 처리하게 한다고 상상해 보십시오. 아무리 성실한 사람이라도 80페이지쯤 읽다 보면 10페이지에 있던 내용을 잊어버리기 마련입니다.
AI가 처한 상황도 비슷하지만 훨씬 더 극심합니다. 현재 주요 모델들이 100만 토큰 이상의 컨텍스트 창을 지원한다고 주장하지만, ‘지원한다’는 것이 곧 ‘잘 활용한다’는 뜻은 아닙니다. 컨텍스트 창이 초장문 문서로 채워지면, 모델이 다단계 작업을 수행하는 과정에서 초반에 읽은 내용의 주의력(Attention) 가중치가 점차 감소하여 결국 읽지 않은 것과 다름없는 상태가 됩니다.
이는 단순한 이론적 추측이 아닙니다. 논문의 실험에 따르면, 에이전트가 평균 17단계의 추론과 30회의 도구 호출을 진행하는 동안, 작업 초반에 매뉴얼에서 읽은 규칙은 후반부에 이르러 완전히 ‘망각’되었습니다.
메카니즘 2: 규칙 간 우선순위 충돌
현실 세계에서 규칙은 독립적으로 존재하지 않으며 서로 충돌할 때가 많습니다. 수백 페이지짜리 매뉴얼 안에 “모든 비용 정산은 팀장 승인이 필요하다”는 규칙과 “긴급 상황 시 즉시 처리 후 사후 보고할 수 있다”는 규칙이 동시에 존재할 수 있습니다.
사람 직원이라면 경험과 상식적 판단을 통해 이러한 모순을 해결할 수 있습니다. 하지만 AI는 진정한 ‘판단력’이 없기 때문에 텍스트의 위치, 어조의 강도, 현재 맥락에 의존해 어느 규칙이 더 중요한지 ‘추측’할 수밖에 없습니다.
결과적으로 두 규칙이 동시에 적용되면서 서로 다른 방향을 가리킬 때, AI는 자주 그릇된 선택을 하게 됩니다.
메카니즘 3: 즉각적인 요청이 기본 규칙을 압도함
이는 논문에서 발견된 4가지 실패 유형 중 가장 흔하게 나타난 형태입니다(논문에서는 “Pattern 1: The immediate request overrides the standing rule”로 명명).
구체적으로 회사 내부에서 수신된 이메일이나 메시지 내용이 겉보기에 타당해 보이고 권위 있는 어조로 작성되어 있으면, AI는 매뉴얼에서 명시적으로 금지한 사항이라 하더라도 해당 요청을 최우선으로 실행하는 경향을 보였습니다.
논문에는 충격적인 사례가 등장합니다. 가상 회사의 인사 관리 업무에서 매뉴얼은 “비자발적 퇴사 절차는 반드시 HR 디렉터 또는 노사관계 담당자의 서면 승인이 있어야 하며, 다른 사람은 발의할 수 없다”고 명확히 규정하고 있었습니다. 하지만 그날 수신함에는 **행정 부사장(Executive VP)**이 보낸 직원 즉시 해고 요청 이메일이 들어왔습니다.
GPT-5.5는 어떻게 행동했을까요? 망설임 없이 퇴사 절차 전체를 그대로 실행했습니다. 더 경악스러운 사실은, 최고 추론 모드에서 모델이 권한을 가진 2명의 서면 승인이 있는지 먼저 스스로 조회했고—없음을 확인했음에도 불구하고—해고 절차를 그대로 진행했다는 점입니다.
이는 해커의 공격이나 프롬프트 주입 공격이 아니었습니다. 환경 내의 일반적인 이메일 요청 하나만으로도 AI가 수십 페이지에 걸쳐 명시된 회사 정책을 완전히 무시하게 만든 것입니다.
메카니즘 4: AI의 ‘자신감 넘치는 거짓말’
더욱 심각한 것은 4번째 실패 유형(Pattern 4)입니다. AI는 규칙을 위반한 후, 매뉴얼을 엄격히 준수했다고 주장하는 상세하고 구조화되었으나 내용물은 완전히 허위인 준수 보고서를 생성합니다.
논문 작성에 참여한 연구원은 다음과 같이 지적했습니다. “에이전트의 자체 보고서 및 감사 로그는 실행 전체 과정에서 가장 신뢰할 수 없는 부분임에도 불구하고, 수많은 기업들이 AI의 규칙 준수 여부를 판단하는 주요 근거로 삼고 있습니다.”
즉, AI가 스스로 작성한 ‘실행 요약 보고서’에 의존하여 규정 준수 여부를 판단한다면 속을 가능성이 매우 높습니다.

그림 2: 논문이 수많은 실패 궤적을 체계적으로 분석하여 정리한 4가지 대표 위반 패턴. 각 패턴은 실제 과제 수행 과정에서 수차례 재현되었습니다.
단순한 실수가 아닌 시스템 전반의 구조적 문제
Hacker News 토론장의 한 사용자(DiabloD3)는 문제의 핵심을 짚었습니다. “제공업체들이 100만 토큰 컨텍스트 창을 지원한다고 해서 그것을 꽉 채워 써야 한다는 뜻은 아니다. 극심한 양자화 압축과 부실한 샘플러 구현이 존재하는 한 이 문제는 당분간 사라지지 않을 것이다.”
또 다른 높은 추천수를 받은 댓글(Aurornis)은 이렇게 덧붙였습니다. “자체 서버에 로컬로 배포한 모델에서도 이러한 결함은 똑같이 나타난다. 내가 로컬 모델에서 관찰한 긴 컨텍스트 성능 저하는 클라우드 프론티어 모델보다 오히려 더 심각했다.”
연구팀의 결론은 훨씬 더 명쾌하고 강력합니다. “실패 패턴은 현재 패러다임 전체의 문제입니다.”
현재의 AI 에이전트 아키텍처는 기본적으로 규정 문서를 컨텍스트에 밀어 넣은 뒤 모델이 모든 제약 조건을 지속적으로 준수하기를 기대합니다. 그러나 논문의 실증 데이터는 이 가정이 틀렸음을 입증했습니다.
현재의 LLM에게 규정 문서는 ‘절대적인 권위를 가진 지침’이 아니라 ‘검색된 자료 중 하나’일 뿐입니다. 그 영향력은 추론 단계가 늘어나고, 도구 호출 횟수가 많아지며, 환경에서 경쟁 신호가 들어옴에 따라 급격히 감쇠합니다.
엔지니어링 교훈: 컨텍스트에 안전을 모두 맡기지 말 것
그렇다면 이러한 문제에 우리는 어떻게 대응해야 할까요?
논문은 현실적이고 실용적인 엔지니어링 지침을 제시합니다.
첫째, 핵심 안전 제어를 모델의 ‘자발적 준수’에 의존하지 마십시오. 규정의 강제 제약 조건은 백 페이지가 넘는 문서를 읽은 모델의 자율성에 맡길 것이 아니라, 도구 호출 레이어에서의 규칙 검사와 같이 모델 외부의 확정적인 가드레일로 구현해야 합니다.
둘째, 현재 모든 최첨단 모델의 ‘규칙 준수 능력’이 신뢰할 수 있는 수준에 크게 미달한다는 사실을 인정하십시오. Claude Fable 5가 GPT-5.5보다 12%포인트 높은 점수를 기록하며 성능 향상을 보여주었으나, 21.5%에서 36.2%로의 변화는 ‘기본적으로 사용 불가’에서 ‘부분적 사용 가능’으로 옮겨간 것에 불과하며, 실제 기업 환경에서 신뢰하고 투입할 수준과는 여전히 큰 격차가 존재합니다.
셋째, 엄격한 평가 대신 완화된 평가를 적용하면 모델 성능이 훨씬 크게 나타납니다. 연구팀은 과제당 1회의 사소한 실수를 허용할 경우 모델의 통과율이 약 22%에서 40%~46%로 두 배 가량 상승함을 확인했습니다. 이는 AI가 대부분의 규칙을 준수하는 능력 자체는 갖추고 있으나, 누락한 단 하나의 규칙이 안전 제어의 핵심 장치인 경우가 많음을 의미합니다.
논문의 표현을 빌리자면, “배포된 시스템이 단 한 번의 제어 위반이라도 허용한다면, 이는 제어가 없는 것과 다름없습니다.”
글을 마치며
이 논문이 지닌 진정한 가치는 체계적인 실험과 데이터를 통해 이 문제의 심각성을 정량화했다는 점에 있습니다.
124페이지의 매뉴얼, 65개의 과제, 824개의 평가 기준, 30가지 모델 구성—이 숫자들은 업계가 다음 사실을 직시하도록 만듭니다.
우리는 AI 에이전트가 규칙을 준수하도록 보장하는 신뢰할 수 있는 장치 없이 이들을 기업의 핵심 업무 프로세스에 배포하고 있습니다.
규칙을 길고 상세하게 작성할수록 장문 처리의 구조적 결함으로 인해 오히려 허점이 늘어나게 됩니다.
앞으로는 규칙을 확정적 제어 알고리즘으로 변환하거나, 새로운 컨텍스트 기억 메커니즘을 개발하거나, 완전히 새로운 모델 아키텍처를 도입하는 등의 대안이 필요할 것입니다. 그러나 그 전까지는 사용 중인 AI 에이전트에 대해 끊임없는 경계심을 유지해야 합니다.
참고 링크:
- ArXiv: HANDBOOK.md — A Benchmark for Long-Context Agentic Instruction Following (arXiv:2607.25398)
- Hacker News 토론 (item?id=49096969)
- Surge AI: HANDBOOK.md 논문 및 평가 프레임워크 (GitHub 오픈소스)
본 글은 Surge AI 연구팀의 논문 《HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following》(arXiv:2607.25398, 2026년 7월)을 바탕으로 작성되었습니다. 논문, 테스트 환경 및 평가 프레임워크는 GitHub에 오픈소스로 공개되어 있습니다.