AI 추론 흔적 추출 방법: 2단계 증류와 API 격리 사례 연구

AI 모델 증류는 LLM 업계에서 가장 민감한 주제 중 하나입니다. 새로운 모델이 갑자기 훨씬 강력해지거나 그 답변이 특정 행동을 닮기 시작하면,

发布于 2026年8月14日generalGEO 评分: 03 次阅读
이미지는 진한 파란색 배경으로, 왼쪽에는 큰 글씨로 '추론 흔적'이라는 제목 아래 '증류 및 API 위험'이라고 표시되어 있습니다. 오른쪽에는 교사 모델, 중간 모델, 학생 모델의 세 가지 모델 노드를 포함한 교사 모델에서 학생 모델로의 추론 과정이 화살표로 표시되어 있습니다. 오른쪽에는 자물쇠가 달린 방패 아이콘 아래 'API 엔드포인트'라고 표시되어 있고 빨간색 느낌표 표시가 있습니다. 이 그림은 문서에서 소개하는 AI 추론 흔적 추출, 모델 증류 및 API 보안 위험에 대한 내용을 반영하여 관련 개념을 직관적으로 보여줍니다.

AI 추론 궤적은 어떻게 추출되는가: 2단계 증류와 API 보안 사례 연구

서론

AI 모델 증류는 LLM 업계에서 가장 민감한 주제 중 하나로 자리 잡았습니다. 새로운 모델이 갑자기 훨씬 강력해지거나, 그 응답이 선도 모델의 행동 특징을 보이기 시작하면, 연구자들은 자연스럽게 어떤 형태의 지식 또는 추론 전이가 있었는지 의문을 제기합니다.

최근 116페이지 분량의 연구 논문이 이 논의에 새로운 유형의 증거를 제시했습니다. 연구자들은 특정 API 워크플로우에서 노출된 숨겨진 추론 상태가 그들이 연구한 조건에서 다른 모델을 통해 복원될 수 있다고 보고했습니다. 같은 연구는 또한 더 광범위한 보안 우려를 제기했습니다: 추론 궤적과 에이전트 행동 경로가 저장, 공유 또는 재생될 때 충분히 엄격한 격리가 이루어지지 않으면 민감한 정보를 포함할 수 있다는 것입니다.

이러한 발견은 AI 증류에 대한 최종 결론이 아닌 하나의 연구 성과로 간주되어야 합니다. 저자들은 모델 간의 모든 유사성이 증류의 존재를 입증한다고 주장하지 않습니다. 대신, 그들의 실험은 추론 궤적이 어떻게 전이, 재현 그리고 노출될 수 있는지에 대한 새로운 증거를 제공합니다.

두 번의 API 호출로 Opus 추론 과정의 베일을 벗기다

MATS Research, ELLIS Institute Tübingen 등의 연구자들은 일반적으로 API 뒤에 숨겨져 있는 추론이 복원될 수 있는지 조사했습니다.

보고된 실험 설정은 더 강력한 모델을 사용해 추론 상태를 생성하고, 같은 모델 계열의 더 작은 모델을 사용해 추론 상태를 해석하는 방식을 사용했습니다. 출처 문서에 설명된 예시에서는 Opus 4.8이 추론을 생성하고 Haiku 4.5가 숨겨진 추론 과정을 노출하는 데 사용되었습니다.

같은 전반적 아이디어가 OpenAI와 Google의 모델을 포함한 다른 모델 생태계에도 적용된 것으로 보고되었습니다. 핵심은 더 작은 모델이 본질적으로 모든 강력한 모델의 내부 상태를 읽을 수 있다는 것이 아니라, 공유된 API 인프라와 호환 가능한 추론 상태 형식이 예상치 못한 상호작용 인터페이스를 만들 수 있다는 점입니다.

출처 문서에 설명된 과정은 놀라울 정도로 단순합니다.

1단계: 더 강력한 모델이 문제를 해결하도록 한다

첫 번째 요청은 Opus 4.8이 8,139,881의 최대 소인수를 찾는 것과 같은 문제를 해결하도록 합니다.

출처 문서에 따르면, API 응답에는 두 가지 관련 정보가 포함되어 있습니다: 처리된 추론 요약과 읽을 수 없어 보이는 긴 문자열입니다. 문서는 후자를 모델의 전체 사고 사슬의 암호화된 표현으로 식별합니다.

2단계: 추론 블록을 다른 모델에 재생한다

보고된 공격은 이후 해당 암호화 블록을 새 요청에 넣고 모델을 Claude Haiku 4.5로 전환합니다.

프롬프트는 더 작은 모델이 계속해서 <thinking-copy> 태그 내에서 제공된 상태와 관련된 추론을 재현하도록 요구합니다.

보고된 실험에 따르면, Haiku는 숨겨진 추론 과정을 재현할 수 있었습니다. 복원된 궤적에는 시행 나눗셈, 배제, 인수분해 및 검증과 같은 작업이 포함된 것으로 알려졌습니다.

보고된 토큰 수 또한 충격적입니다. 출처 문서는 추출된 추론 토큰 수가 API에서 실제로 청구된 생각 토큰 수에 근접했다고 밝히며, 이는 복원된 자료가 단순한 요약이 아님을 시사합니다.

왜 더 작은 모델이 더 강력한 모델의 숨겨진 상태를 읽을 수 있는가?

이것이 핵심 기술적 질문입니다.

추론 모델은 일반적으로 다단계 작업을 수행해야 합니다. 에이전트형 작업에서 모델은 웹을 검색하고, 코드를 실행하고, 도구를 호출하고, 결과를 확인한 다음, 얻은 상태에서 추론을 계속할 수 있습니다.

이 상태는 API 호출 간에 보존되어야 합니다.

한 가지 가능한 아키텍처는 모든 것을 제공업체 서버에 저장하는 대신 클라이언트에 상태를 저장하는 것입니다. 모델의 추론 상태는 암호화된 블록으로 패키징되어 클라이언트에 반환되고, 이후 요청에서 다시 제공될 수 있습니다. 서버는 블록을 해독하여 모델이 중단된 지점에서 계속할 수 있게 합니다.

이러한 설계는 서버 측 저장 요구를 줄이고 개인정보 보호 중심의 워크플로우를 지원할 수 있습니다. 그러나 신중하게 구현해야 하는 보안 경계를 생성하기도 합니다.

보고된 문제는 암호화된 추론 블록이 항상 원래 컨텍스트와 충분히 결합되지 않는다는 것입니다. 연구자들이 연구한 조건에서 이는 세 가지 형태의 상호운용성을 만들어 냈습니다:

  1. 세션 간: 이전 세션의 추론 블록을 새 세션에 재사용할 수 있습니다.
  2. 사용자 간: 공개적으로 노출된 추론 블록을 다른 사용자가 제출할 수 있습니다.
  3. 모델 간: 더 강력한 모델이 생성한 추론 블록을 같은 제공업체의 다른 모델이 처리할 수 있습니다.

이러한 동작에는 합리적인 엔지니어링 동기가 있을 수 있습니다. 모델 전환, 장애 조치 시스템, 컨텍스트 압축 및 장기 실행 에이전트 워크플로우 모두 재사용 가능한 상태의 혜택을 받습니다.

문제는 상태가 원래 사용자, 세션, 모델 및 권한 부여된 컨텍스트로 엄격히 제한되지 않으면 동일한 상호운용성이 공격 표면이 될 수 있다는 점입니다.

저비용 디코더가 경제성을 바꿀 수 있다

또 다른 중요한 발견은 비용과 관련됩니다.

출처 문서는 인용된 Haiku 4.5 API 가격 가정 하에, 각 궤적당 약 12,000개의 입력 및 출력 토큰이 포함될 때 10,000개의 추론 궤적을 디코딩하는 명목 비용이 약 720달러라고 추정했습니다.

이는 추론 궤적 추출의 경제성을 변화시킵니다. 값비싼 모델이 원시 상태 생성에만 사용되고 더 저렴한 모델이 디코딩을 수행한다면, 고급 모델에 대한 값비싼 접근 권한이 필요한 공격이 더 실용적이 될 수 있습니다.

이는 특히 모델 제공업체에게 중요합니다. 추론 궤적은 추론 과정에서 창출된 가치의 상당 부분을 대표할 수 있기 때문입니다. 이러한 궤적이 의도된 경계 밖에서 복원되고 재사용될 수 있다면, 모델 지식 재산 유출의 새로운 형태가 될 수 있습니다.

증류의 미스터리에 첫 번째 증거가 나타나다

연구자들이 더 완전한 추론 궤적을 확보한 후, 그들은 이를 사용해 더 광범위한 질문을 탐구했습니다: 모델 고유의 추론 패턴이 증류의 증거를 밝혀낼 수 있을까?

연구자들은 두 가지 실험을 수행했습니다.

실험 1: 연속적인 추론 토큰 재현

첫 번째 실험에서 연구자들은 Opus 추론 궤적에서 연속된 16개의 토큰을 선택하고 여러 모델에게 같은 문제를 계속해서 풀도록 했습니다.

아이디어는 간단합니다: 한 모델이 다른 모델보다 훨씬 쉽게 완전히 동일한 연속 텍스트를 재현할 수 있다면, 이는 그 모델이 원본 모델의 추론 패턴과 비정상적으로 가까운 것을 학습했음을 나타낼 수 있습니다.

보고된 차이는 매우 컸습니다.

한 모델은 선택된 Opus 구절을 우연히 재현하는 데 이론적으로 약 100억 번의 시도가 필요했습니다. 다른 두 모델은 각각 약 100조 번과 1000조 번의 시도가 필요할 것으로 추정되었습니다.

즉, 보고된 비교에서 한 모델이 동일한 Opus 추론 패턴을 재현하는 용이성은 대체 모델보다 약 백만 배 높았습니다.

실험 2: 추론 시작 부분만 주입

두 번째 실험은 다른 모델에게 Opus 추론 궤적의 시작 부분만 제공하고 응답이 어떻게 전개되는지 관찰했습니다.

한 예에서는 단 5개의 토큰만 제공되었습니다.

보고에 따르면, 이렇게 적은 정보만으로도 대상 모델의 표현, 답변 및 문제 해결 리듬이 Opus 궤적으로 이동했습니다. 보고된 유사도 점수는 0.17에서 0.33으로 상승했습니다.

연구자들은 이후 테스트를 30개 문제로 확장했습니다. 출처 문서에 따르면, 그중 29개 문제에서 동일한 전반적 효과가 나타났습니다: 모델에게 Opus 스타일의 시작점을 제공하면 다른 모델의 시작점을 사용할 때보다 후속 응답이 Opus와 더 유사해졌습니다.

이것이 증류를 증명할 수 있을까?

이것만으로는 충분하지 않습니다.

출처 문서는 연구자들이 증류 문제가 해결되었다고 선언하지 않았다고 강조합니다. 출력 또는 추론 패턴의 유사성은 조사할 가치가 있는 증거이지만, 한 모델이 다른 모델의 비공개 추론 데이터를 직접 기반으로 훈련되었다는 것을 자동으로 입증하지는 않습니다.

이 실험들이 제공하는 것은 모델 고유의 추론 특징을 연구할 수 있는 더 구체적인 방법입니다. 이제 더 긴 추론 궤적을 분석할 수 있기 때문입니다.

GitHub 및 공개 에이전트 궤적이 또 다른 보안 문제를 야기하다

이 문제는 모델 회사에만 국한되지 않습니다.

보고에 따르면, 연구자들은 GitHub와 Hugging Face에서 공개적으로 사용 가능한 6,708개의 에이전트 궤적을 수집하고 315,320개의 추론 블록을 재구성했습니다.

이 궤적 중 328개는 최소 하나의 민감한 항목을 포함하고 있었으며, 이는 수집된 궤적의 약 4.9%에 해당합니다.

출처 문서는 연구자들이 다음을 발견했다고 보고했습니다:

  • API 키 62개
  • 비밀번호 33개
  • 액세스 토큰 24개
  • 개인 키 7개
  • 개인 이메일 주소 30개
  • 개인 이름 130개
  • 우편 주소 36개

이것은 에이전트 시스템을 구축하는 개발자에게 실질적인 경고입니다.

궤적이 평범한 디버그 출력처럼 보일 수 있지만, 도구 매개변수, 환경 변수, 자격 증명, 개인 정보, 내부 URL 또는 공개 훈련 세트나 저장소의 일부가 절대 되어서는 안 되는 기타 데이터를 포함할 수 있습니다.

에이전트 궤적이 기록, 공유 또는 게시될 예정이라면, 개발자는 이를 일반적인 애플리케이션 로그가 아닌 잠재적으로 민감한 데이터로 취급해야 합니다.

자주 묻는 질문

AI 추론 궤적이란 무엇인가요?

AI 추론 궤적은 모델이 작업을 수행하는 과정에서 생성된 중간 상태 또는 추론 관련 출력입니다. API 설계에 따라 사용자는 모델의 원시 내부 계산 대신 요약, 구조화된 추론 상태 또는 암호화된 표현을 받을 수 있습니다.

AI 모델 증류란 무엇인가요?

모델 증류는 더 작거나 다른 모델이 더 크거나 강력한 모델의 행동을 학습하도록 하는 기술입니다. 이는 실행 비용이 더 낮거나 속도가 더 빠른 모델에 유용한 능력을 전이하는 데 널리 사용됩니다.

추론 궤적을 복원하면 모델이 증류되었음을 증명할 수 있나요?

아니요.

복원된 추론 궤적은 모델 유사성에 대한 증거를 제공할 수 있지만, 그 자체만으로는 모델이 어떻게 학습되었는지를 확정할 수 없습니다. 더 강력한 귀속을 위해서는 학습 데이터 출처, 통제된 실험 및 기타 증거가 필요합니다.

왜 암호화된 추론 상태가 보안 위험이 될 수 있나요?

암호화는 상태 블록의 내용을 보호하지만, 해당 상태 블록이 올바른 사용자, 세션, 모델 또는 권한 부여 컨텍스트에 바인딩되어 있다는 것을 자동으로 보장하지는 않습니다. 이러한 경계가 약한 경우, 유효한 암호화 상태가 의도하지 않은 컨텍스트에서 재생될 수 있습니다.

왜 에이전트 궤적이 민감한가요?

에이전트 궤적에는 도구 호출, 프롬프트, 환경 변수, API 자격 증명, 개인 데이터, 내부 파일 경로 및 실행 중 수집된 기타 정보가 포함될 수 있습니다. 따라서 적절한 정리 없이 이를 공개하면 원래 애플리케이션이 무해해 보이더라도 기밀 정보가 노출될 수 있습니다.

개발자는 GitHub에 원본 AI 에이전트 궤적을 게시해야 하나요?

신중한 검토와 정리를 거치지 않는 한 원본 궤적을 게시하는 것을 피해야 합니다. 궤적을 공유하기 전에 기밀 정보, 토큰, 자격 증명, 개인 정보, 비공개 URL 및 독점 데이터를 제거해야 합니다.

작은 모델이 항상 큰 모델의 추론을 디코딩할 수 있나요?

아닙니다. 보고된 결과는 특정 API 동작, 모델 계열, 추론 상태 형식 및 실험 조건에 따라 달라집니다. 이는 작은 모델이 항상 큰 모델의 추론을 복구할 수 있다는 일반적인 법칙으로 해석되어서는 안 됩니다.

관련 도구

관련 링크

  • Anthropic 문서: 공식 Claude API 및 개발자 문서.
  • OpenAI 문서: 공식 OpenAI API 문서.
  • Google AI 개발자: 공식 Gemini 및 Google AI 개발자 리소스.
  • GitHub: 공개 에이전트 궤적과 관련된 소스 코드 호스팅 및 협업 플랫폼.
  • [Hugging

Face](https://huggingface.co/): 원문에서 인용된 모델 및 데이터셋 허브.

요약

보고된 연구는 AI 추론 상태를 둘러싼 미묘하지만 중요한 보안 경계를 조명합니다. 추론 블록이 엄격한 권한 부여 바인딩 없이 세션, 사용자 또는 모델 간에 재생될 수 있다면, 효율적인 상태 관리를 지원하기 위해 설계된 기능이 예상치 못한 추출 채널로 변할 수 있습니다.

이 연구는 또한 최종 답변에만 의존하는 대신 더 긴 추론 궤적을 검사하여 모델 유사성과 가능한 증류(distillation)를 조사하는 새로운 방법을 제공합니다. 동시에 이러한 발견은 특정 모델이 승인되지 않은 증류를 통해 학습되었다는 최종적인 결론은 아닙니다.

개발자에게 가장 직접적인 교훈은 실용적입니다: 추론 상태와 에이전트 궤적을 민감한 데이터로 취급하고, 저장 또는 공유 전에 신원, 세션, 모델 및 접근 경계 바인딩을 엄격히 적용하십시오.

AI推理痕迹如何被提取:两阶段蒸馏与API隔离案例研究