simoori.AI·IT 소식에서 신호만 골라 훑는 곳
피드로

오픈AI, 모델 개발 초기부터 외부 안전성 검증 받는다

오픈AI가 모델 출시 전뿐 아니라 학습과 평가 단계부터 외부 기관의 안전성 검증을 받기로 했다.

AI타임스 · 23일 오후 · 분야 AI 모델 · 분야 보안 · 사건종류 정책 결정

signal 포인트

핵심

  1. 오픈AI는 학습, 평가, 배포 전 과정에서 외부 기관이 기술적 안전성 평가를 수행하도록 할 계획이다.
  2. 평가 대상에는 안전성 사례 검증, 탈옥 및 사이버 위험 안전장치 점검, 능력 평가, 오정렬 사고 조사가 포함된다.
  3. 오픈AI는 METR과 레드우드 리서치 등 기존 및 신규 외부 평가기관과 협의를 진행하고 있다고 밝혔다.

요약은 자동으로 만들어집니다. 사실 확인이 필요하면 원문을 읽어주세요.

원문 보기 (한국어)

아래는 출처에서 가져온 원문입니다.

(사진=오픈AI)

(사진=오픈AI)

오픈AI가 AI 모델의 출시 직전뿐 아니라 학습과 평가 등 개발 초기 단계부터 외부 독립기관이 안전성을 점검할 수 있도록 평가 권한을 확대한다. AI 모델이 예상치 못한 방식으로 작동하거나 다른 시스템에 접근하는 사례가 잇따르면서 개발 과정 전반에 대한 독립적인 검증을 강화하려는 조치다.

오픈AI는 22일(현지시간) AI 모델의 학습·평가·배포 과정에서 외부 기관이 기술적 안전성 평가를 수행하도록 할 계획이라고 밝혔다. 라마 아마드 오픈AI 외부 안전성 검토 담당자는 "위험이 커지고 있는 만큼 배포뿐 아니라 높은 위험이 수반되는 학습과 평가 과정도 살펴볼 필요가 있다"고 말했다.

이전부터 이 회사는 주요 모델 출시 전 안전성 평가나 능력 평가를 위해 외부 기관을 활용해 왔다. 앞으로는 개발 과정에 외부 평가기관을 더 이른 시점부터 참여시키고, 민감한 경우에는 평가단을 사무실로 불러 제한된 환경에서 직접 접근하도록 하는 방안도 검토한다.

외부 평가기관과의 협력은 모델의 안전성 주장을 독립적으로 검증하고 개발사가 놓친 위험을 찾아내는 데 초점이 맞춰진다. 평가의 핵심 원칙으로 강력한 독립성 확보, 과학적 엄밀성, 견고한 보안 체계, 명확한 책임 분담을 제시했다. 평가기관에는 합의된 범위 안에서 필요한 수준의 접근 권한을 제공하되, 지식재산과 민감한 정보는 보호한다는 방침이다.

평가 대상은 크게 네 분야다. 우선 학습과 평가, 내부·외부 배포에 이르는 전 과정의 '안전성 사례(safety case)'를 독립적으로 검증한다. 이어 탈옥 공격이나 사이버·생물학적 위험 등에 대한 안전장치가 실제 환경에서 제대로 작동하는지 평가한다.

화학·생물학적 위험, 사이버보안, AI 자기개선 및 심각한 오정렬 위험을 다루는 능력 평가도 점검 대상이다. 마지막으로 모델이 감독을 회피하거나 승인되지 않은 행동을 하는 등 중대한 오정렬 사고가 발생할 경우 독립적인 사고 조사도 진행한다.

오픈AI는 AI 연구 기관 METR과 레드우드 리서치(Redwood Research)를 비롯해 기존에 협력했던 기관과 새로운 외부 조직을 포함해 여러 평가기관과 협의하고 있다고 밝혔다. 레드우드 리서치는 앞서 오픈AI 모델의 허깅페이스 관련 침해 사건 조사에도 참여했다.

이번 방침은 경쟁 AI 기업들의 움직임과도 맞물려 있다. 다리오 아모데이 앤트로픽 CEO는 AI 개발 속도를 늦추고 제3자 평가기관을 활용해야 한다고 주장했으며, 샘 알트먼 오픈AI CEO도 이에 동의했다. 또 앤트로픽은 최근 액센추어의 평가자들을 자사 최첨단 AI 모델의 안전성 테스트에 참여시키겠다고 밝혔다.

오픈AI는 "연구소에는 민감한 정보를 보호하면서도 의미 있는 검증을 가능하게 할 책임이 있다"고 강조했다. 또 각국 정부 및 민간 부문이 활용할 수 있는 AI 안전성 평가 기준을 마련하기 위해 국제적으로 공유되는 안전·보안 표준을 구축해야 한다고 밝혔다.

박찬 기자 cpark@aitimes.com

원문의 저작권은 출처에 있습니다.출처에서 원문 보기 새 창에서 열림