# AI의 중간 추론을 읽기 어려워지면 안전 감시는 어떻게 달라질까

> 반복 연산과 벡터 형태의 추론은 모델의 성능을 높일 수 있지만, 사람이 읽는 사고 기록만으로 안전성을 확인하기 어려워질 수 있다는 우려가 나왔습니다.

Oossa · 2026-10-03 · https://oossa.com/ko/ai

AI 모델이 답을 내기까지의 과정을 사람의 언어로 보여주는 ‘사고의 사슬(CoT)’을 안전 감시 도구로 쓰기 어려워질 수 있다는 우려가 제기됐습니다. 월스트리트저널은 현지시간 2일, 모델이 실제로 내부에서 처리한 내용과 사용자에게 제시하는 설명 사이의 차이가 커지고 있다고 보도했습니다.

문제는 모델의 추론이 사람이 읽을 수 있는 문장으로 드러나지 않을 수 있다는 점입니다. 연구자들은 이런 경우 중간 과정을 살펴 악성 행동을 미리 찾거나, 모델이 왜 그런 결론을 냈는지 확인하기가 더 어려워질 수 있다고 경고합니다.

## 같은 신경망을 여러 번 돌리는 방식

디 인포메이션은 OpenAI의 「아스트라」에 적용된 것으로 알려진 ‘순환 깊이 트랜스포머’, 또는 ‘루프 트랜스포머’를 사례로 들었습니다. 일반적인 트랜스포머가 여러 신경망 층을 차례로 통과하는 것과 달리, 이 방식은 하나의 신경망 블록을 반복해서 사용합니다. 매개변수를 재사용해 층을 늘리지 않고도 더 오래 연산하도록 하는 구조입니다.

기사에 따르면 이런 방식은 코딩과 수학 같은 작업에서 메모리와 데이터 전송 부담을 줄이면서 성능을 높이는 데 도움이 될 수 있습니다. 다만 추론이 문장이 아닌 숫자 벡터 형태로 이어지면, 사람이 중간 단계를 직접 읽기 어려워집니다. 연구자들이 이를 ‘연속 사고의 사슬(Coconut)’이라고 부릅니다.

## 설명은 정확한 기록이 아닐 수 있다

OpenAI의 수석 과학자 야쿠브 파초키는 공식 블로그에서 CoT 모니터링이 모델의 일반화 방식을 연구하는 데 중요했지만, 상황이 나빠지고 있다고 썼습니다. 그는 AI의 안전과 감시를 강화하고, 효과를 확인할 수 있을 때까지 개발 속도를 늦추기 위해 협력해야 한다고 주장했습니다.

앨런 AI 연구소의 프라딥 다시기는 모델이 정답뿐 아니라 추론 과정을 정확히 기록하도록 훈련되는 것은 아니라고 지적했습니다. 앤트로픽 연구진도 모델이 결론을 먼저 정한 뒤 그럴듯한 설명을 나중에 붙이는 경우를 관찰했다고 밝혔습니다. 따라서 공개된 추론 설명이 실제 내부 과정을 그대로 보여준다고 단정하기는 어렵습니다.

## 팩트

- 월스트리트저널은 현지시간 2일 AI의 내부 처리와 외부 설명 사이의 간격이 커지고 있다고 보도했습니다.
- 루프 트랜스포머는 같은 신경망 블록을 여러 차례 반복해 사용합니다.
- 기사에 따르면 순환 깊이 방식은 코딩과 수학 작업에서 메모리와 대역폭 비용을 줄이는 데 도움을 줄 수 있습니다.
- 야쿠브 파초키는 CoT 모니터링을 강화하고 효과를 확인할 때까지 개발 속도를 늦추기 위해 협력해야 한다고 주장했습니다.

## 왜 중요한가

AI를 쓰는 사람에게는 모델이 제시하는 추론 설명을 안전성이나 규칙 준수의 확실한 증거로 보기 어렵다는 점이 중요합니다. 설명과 내부 처리의 차이가 실제 배포된 모델의 위험을 얼마나 키우는지, 또 어떤 감시 방법이 이를 보완할 수 있는지는 기사에서 확인되지 않았습니다.

## 출처 및 참고 자료

1. [AI '생각의 사슬' 무력화되나…'순환 깊이' 기술이 부른 불투명성 우려](https://www.aitimes.com/news/articleView.html?idxno=215934) – AI Times, 2026-10-03

최종 업데이트: 2026-10-03
