AI 모델이 답을 내기까지의 과정을 사람의 언어로 보여주는 ‘사고의 사슬(CoT)’을 안전 감시 도구로 쓰기 어려워질 수 있다는 우려가 제기됐습니다. 월스트리트저널은 현지시간 2일, 모델이 실제로 내부에서 처리한 내용과 사용자에게 제시하는 설명 사이의 차이가 커지고 있다고 보도했습니다.
문제는 모델의 추론이 사람이 읽을 수 있는 문장으로 드러나지 않을 수 있다는 점입니다. 연구자들은 이런 경우 중간 과정을 살펴 악성 행동을 미리 찾거나, 모델이 왜 그런 결론을 냈는지 확인하기가 더 어려워질 수 있다고 경고합니다.
같은 신경망을 여러 번 돌리는 방식
디 인포메이션은 OpenAI의 「아스트라」에 적용된 것으로 알려진 ‘순환 깊이 트랜스포머’, 또는 ‘루프 트랜스포머’를 사례로 들었습니다. 일반적인 트랜스포머가 여러 신경망 층을 차례로 통과하는 것과 달리, 이 방식은 하나의 신경망 블록을 반복해서 사용합니다. 매개변수를 재사용해 층을 늘리지 않고도 더 오래 연산하도록 하는 구조입니다.
기사에 따르면 이런 방식은 코딩과 수학 같은 작업에서 메모리와 데이터 전송 부담을 줄이면서 성능을 높이는 데 도움이 될 수 있습니다. 다만 추론이 문장이 아닌 숫자 벡터 형태로 이어지면, 사람이 중간 단계를 직접 읽기 어려워집니다. 연구자들이 이를 ‘연속 사고의 사슬(Coconut)’이라고 부릅니다.
설명은 정확한 기록이 아닐 수 있다
OpenAI의 수석 과학자 야쿠브 파초키는 공식 블로그에서 CoT 모니터링이 모델의 일반화 방식을 연구하는 데 중요했지만, 상황이 나빠지고 있다고 썼습니다. 그는 AI의 안전과 감시를 강화하고, 효과를 확인할 수 있을 때까지 개발 속도를 늦추기 위해 협력해야 한다고 주장했습니다.
앨런 AI 연구소의 프라딥 다시기는 모델이 정답뿐 아니라 추론 과정을 정확히 기록하도록 훈련되는 것은 아니라고 지적했습니다. 앤트로픽 연구진도 모델이 결론을 먼저 정한 뒤 그럴듯한 설명을 나중에 붙이는 경우를 관찰했다고 밝혔습니다. 따라서 공개된 추론 설명이 실제 내부 과정을 그대로 보여준다고 단정하기는 어렵습니다.
왜 중요한가
AI를 쓰는 사람에게는 모델이 제시하는 추론 설명을 안전성이나 규칙 준수의 확실한 증거로 보기 어렵다는 점이 중요합니다. 설명과 내부 처리의 차이가 실제 배포된 모델의 위험을 얼마나 키우는지, 또 어떤 감시 방법이 이를 보완할 수 있는지는 기사에서 확인되지 않았습니다.