복잡한 작업 수행 능력 높아졌지만 신뢰성 문제…차기 모델 안전 강화에 집중
[금융소비자뉴스 정연임 기자] 오픈AI가 차세대 인공지능(AI) 모델의 성능 향상에도 불구하고 공개 출시를 포기했다. 사람의 의도를 제대로 따르는지, 승인받은 범위 안에서 행동하는지 등을 평가하는 내부 안전성 검증에서 문제가 확인됐기 때문이다.
현재 AI 업계에서는 개발 속도와 안전장치 사이의 균형을 요구하는 목소리가 커지고 있다. 샘 올트먼 오픈AI 최고경영자(CEO)와 경쟁사 앤트로픽의 다리오 아모데이 CEO 등은 최근 첨단 AI 개발 속도를 늦추고 안전 대책을 강화해야 한다는 입장을 내놓았다.
연합뉴스에 따르면 월스트리트저널(WSJ)은 28일(현지시간) 오픈AI가 오는 10월 선보일 예정이던 ‘GPT-6.1 아스트라(Astra)’의 출시 계획을 철회했다고 보도했다. 해당 모델은 대화형 AI 서비스 챗GPT와 코딩 도구 코덱스에 적용될 예정이었다. 로이터도 GPT-6.1 아스트라가 오픈AI의 안전·정렬 기준을 충족하지 못해 출시가 취소됐다고 전했다.
출시를 가로막은 핵심은 모델의 ‘정렬(alignment)’과 ‘범위 권한(scope authorization)’ 문제다. 정렬은 AI가 인간의 의도와 지시에 맞춰 행동하는지를 평가하는 개념이다.
사치 자인 오픈AI 안전시스템 책임자는 GPT-6.1 아스트라가 이전 모델과 비교해 두 영역에서 퇴보했으며, 안전하게 공개하기에는 충분한 신뢰성을 확보하지 못했다는 취지로 설명했다.
오픈 AI, ‘기만·무단 실행’ 안전성에 제동
특히 모델이 자신이 실제로 수행한 작업과 수행하지 않은 작업을 사용자에게 일관되고 정확하게 알리지 않는 등 이전 모델보다 기만적인 행동을 보인 것으로 전해졌다. 로이터 역시 아스트라가 인간의 의도를 따르는 정렬 평가에서 회사 기준에 미달했고, 자신의 행동을 정확하게 공개하지 않는 사례가 나타났다고 보도했다.
사용자의 승인 범위를 넘어 행동하려는 문제도 확인됐다. 모델이 별도의 허가를 구하지 않은 채 작업을 계속하거나, 안전성이 확보되지 않은 상황에서 외부 도구나 서비스를 이용하려는 행동을 보였다는 것이다.
반면 작업 수행 능력 자체는 개선된 것으로 평가됐다. GPT-6.1 아스트라는 복잡한 과제를 사람의 도움 없이 처음부터 끝까지 처리하는 능력과 작문 등에서 기존 모델보다 높은 성능을 보인 것으로 전해졌다. 작업 도중 난관에 부딪혔을 때 지나치게 소극적으로 대응하는 이른바 모델의 ‘게으름’ 문제도 개선됐다.
자인 책임자는 안전성과 정렬 과정에서 균형을 찾는 것이 중요하다고 설명했다. AI가 사용자가 허용한 범위를 벗어나서는 안 되지만, 동시에 장애물이 생겼다는 이유만으로 작업 수행을 쉽게 포기해서도 안 된다는 의미다.
이번 결정은 AI 모델의 성능 경쟁에서 안전 문제가 실제 제품 출시를 중단시키는 변수로 부상했음을 보여준다. WSJ은 내부 연구진이 테스트 과정에서 제기한 우려로 신모델 공개가 철회된 이번 사례가 AI 에이전트의 오작동이 업계의 빠른 기술 개발에 제동을 걸 수 있음을 보여준다고 평가했다.

