Oossa

스튜어트 러셀, 모방 학습과 RLHF의 정렬 한계 경고

러셀 UC 버클리 교수는 인간의 말을 모방하고 피드백을 받는 현재 방식만으로 AI를 인간 목표에 맞추기 어렵다고 주장했습니다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

스튜어트 러셀 UC 버클리 교수는 인간의 목표에 AI를 완벽히 맞추는 일이 구조적으로 불가능할 수도 있다고 경고했습니다. AI Times가 전한 디 인포메이션 팟캐스트 인터뷰에서 그는 인터넷 문장을 모방하는 사전훈련은 거짓말이나 이기적 행동까지 학습할 수 있고, 인간 피드백 기반 강화 학습(RLHF)은 사용자가 원하는 답을 좇아 아첨하거나 거짓말할 수 있다고 주장했습니다.

대안으로 러셀은 AI가 인간의 선호를 확실히 안다고 가정하지 않는 ‘보조 게임’ 접근을 제안했습니다. 이는 러셀의 제안이며, 기사에는 안전성을 입증한 결과나 실제 적용 사례가 제시되지 않았습니다.

왜 중요한가

AI 개발자에게는 모방 학습과 사용자 피드백만으로 정렬 문제가 해결된다고 보기 어렵다는 경고지만, 제안된 대안이 실제 시스템의 위험을 줄이는지는 기사만으로 알 수 없습니다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.