simoori.AI·IT 소식에서 신호만 골라 훑는 곳
피드로

앤트로픽, 클로드 오퍼스 5.5 공개…클로드 5.5 패밀리 첫 모델, 성능은 높이고 운영비는 40% 낮췄다

앤트로픽이 클로드 오퍼스 5.5를 공개해 코딩과 업무 성능을 높이고 운영 비용을 40% 낮췄다.

인공지능신문 · 23일 오후 · 분야 AI 모델 · 사건종류 출시

signal 포인트

핵심

  1. 클로드 오퍼스 5.5는 68만 줄 규모 코드 마이그레이션을 하루도 안 돼 끝내는 등 대규모 코딩 성능을 크게 높였다.
  2. 앤트로픽은 100만 토큰당 입력 4달러 출력 20달러로 가격을 낮춰 전작보다 각각 20% 저렴해졌다.
  3. 앤트로픽은 프롬프트 인젝션 방어와 자체 정렬 평가를 강화해 장시간 자율 작동하는 에이전트의 안전성을 높였다.
요약 표
항목오퍼스 5 대 오퍼스 5.5
입력 가격(100만 토큰)5달러 대 4달러
출력 가격(100만 토큰)25달러 대 20달러
캐시 읽기 가격0.50달러 대 0.20달러
캐시 쓰기 가격6.25달러 대 5달러
20만 줄 코드 감사 시간20시간 이상 대 3시간 미만
금융 모델링 작업 시간93분 대 63분
출력 생성 속도기준 대 30% 이상 향상

요약은 자동으로 만들어집니다. 사실 확인이 필요하면 원문을 읽어주세요.

원문 보기 (한국어)

아래는 출처에서 가져온 원문입니다.

이미지:앤트로픽
이미지:앤트로픽

앤트로픽(Anthropic)이 22일(현지시간) 차세대 인공지능 모델 '클로드 오퍼스 5.5(Claude Opus 5.5)'를 공개했다. 클로드 5.5 패밀리의 첫 모델로, 전작인 클로드 오퍼스 5와 비교해 추론 및 서비스 운영 비용을 줄이면서 코딩과 컴퓨터 활용, 전문 지식 업무 전반의 성능을 끌어올린 것이 핵심이다.

앤트로픽은 클로드 오퍼스 5.5가 대부분의 작업에서 클로드 페이블 5.1(Claude Fable 5.1) 수준의 성능을 제공하면서, 일반적인 작업 기준으로 오퍼스 5보다 운영 비용이 40% 낮다고 밝혔다.

이번 모델은 앤트로픽이 프런티어 AI 개발 속도 조절을 공개적으로 제안한 이후 처음 선보이는 모델이기도 하다. 앤트로픽은 출시 전 프런티어 디자인(Frontier Design)과 METR 등 외부 평가기관의 검증을 진행했으며, 자체 자동화 행동 감사에서 지금까지 시험한 모델 가운데 가장 높은 정렬 성능을 기록했다고 설명했다.

코딩·에이전트 성능 개선… 대규모 작업 처리 역량 강화

클로드 오퍼스 5.5는 복잡하고 장시간 이어지는 소프트웨어 개발 작업에서 성능 향상을 보였다. 앤트로픽에 따르면 초기 테스트에서 한 사용자는 68만 줄 규모의 코드 마이그레이션을 하루도 안 돼 완료했다. 기존에는 엔지니어링팀이 수 주에 걸쳐 수행해야 할 것으로 예상된 작업이다.

또 다른 테스트에서는 20만 줄 규모의 코드베이스를 감사하고 오류를 수정하는 데 3시간 미만이 소요됐다. 전작 오퍼스 5는 같은 작업에 20시간 이상 걸렸으며, 토큰도 2.5배 더 사용했다.

웹 애플리케이션 최적화에서도 개선이 확인됐다. 앤트로픽이 앱의 모든 페이지 로딩 시간을 줄이도록 요청한 테스트에서 오퍼스 5.5는 40회 중 39회 성공했다. 반면 오퍼스 5는 개선 폭이 상대적으로 작았고, 일부 작업에서는 앱 동작까지 바꾸는 결과를 냈다.

앤트로픽은 오픈소스 로드밸런서 하프록시(HAProxy)를 C에서 러스트(Rust)로 변환하는 내부 테스트도 진행했다. 오퍼스 5.5와 페이블 5.1 모두 기존 회귀 테스트 대부분을 통과했으며, 오퍼스 5.5는 9.5시간 만에 작업을 마쳐 페이블 5.1의 12시간보다 빨랐다. 비용도 51% 적게 들었다.

에이전틱 코딩 벤치마크에서도 성능과 비용 효율성을 강조했다. 터미널 벤치 4.0(Terminal-Bench 4.0)에서 오퍼스 5.5는 GPT-6 아스트라(GPT-6 Astra)와 비슷한 성능을 약 40%의 작업 비용으로 구현했다. 커서벤치(CursorBench)에서는 GPT-5.6 솔(GPT-5.6 Sol)보다 11점 높은 점수를 기록하면서 작업 비용은 약 3분의 1 수준이었다고 밝혔다.

1. 터미널 벤치 4.0(Terminal-Bench 4.0)클로드 오퍼스 5.5의 표준오차는 ±2.6점이며, 다른 클로드 모델들의 표준오차는 ±1.6~2점이다. 공개 리더보드에서 클로드 코드(Claude Code) 하네스를 사용해 작업당 5회씩 시험한 결과, 클로드 오퍼스 5의 점수는 51.8%로 집계됐다. 앤트로픽의 평가 환경에서는 52.3%로 재현됐으며, 이는 통계적 오차 범위 내에 해당한다. GPT-6 아스트라와 GPT-5.6 솔의 수치는 오픈AI가 공개한 결과를 인용했다. 2. 오토메이션벤치(AutomationBench)오토메이션벤치 평가 결과는 재피어(Zapier)가 직접 수행하고 공개했다. 해당 시험은 대체 모델로 전환하는 폴백(fallback) 기능 없이 진행됐으며, 이에 따라 보호조치가 개입한 경우 실패로 처리됐다. 이로 인해 실제 환경에서 클로드 오퍼스 5.5가 달성할 수 있는 수준보다 낮은 점수가 산출됐을 수 있다.클로드 오퍼스 5.5의 결과는 얼리 액세스 기간에 재피어가 자체 평가한 수치다. 오퍼스 5, GPT-5.6 솔, GPT-6 아스트라의 결과는 재피어의 공개 리더보드에서 가져왔다. 3. 터미널 벤치 사이언스 0.1(Terminal-Bench-Science 0.1)모델별 표준오차는 ±3.5~5점이다. 공개 리더보드에서 클로드 코드 하네스를 사용해 작업당 3회씩 시험한 결과, 클로드 오퍼스 5의 점수는 30.0%로 집계됐다. 앤트로픽의 평가 환경에서는 29.0%로 재현됐으며, 이는 통계적 오차 범위 내에 해당한다. GPT-6 아스트라의 수치는 오픈AI가 공개한 결과를 인용했다.
1. 터미널 벤치 4.0(Terminal-Bench 4.0)클로드 오퍼스 5.5의 표준오차는 ±2.6점이며, 다른 클로드 모델들의 표준오차는 ±1.6~2점이다. 공개 리더보드에서 클로드 코드(Claude Code) 하네스를 사용해 작업당 5회씩 시험한 결과, 클로드 오퍼스 5의 점수는 51.8%로 집계됐다. 앤트로픽의 평가 환경에서는 52.3%로 재현됐으며, 이는 통계적 오차 범위 내에 해당한다. GPT-6 아스트라와 GPT-5.6 솔의 수치는 오픈AI가 공개한 결과를 인용했다. 2. 오토메이션벤치(AutomationBench)오토메이션벤치 평가 결과는 재피어(Zapier)가 직접 수행하고 공개했다. 해당 시험은 대체 모델로 전환하는 폴백(fallback) 기능 없이 진행됐으며, 이에 따라 보호조치가 개입한 경우 실패로 처리됐다. 이로 인해 실제 환경에서 클로드 오퍼스 5.5가 달성할 수 있는 수준보다 낮은 점수가 산출됐을 수 있다.클로드 오퍼스 5.5의 결과는 얼리 액세스 기간에 재피어가 자체 평가한 수치다. 오퍼스 5, GPT-5.6 솔, GPT-6 아스트라의 결과는 재피어의 공개 리더보드에서 가져왔다. 3. 터미널 벤치 사이언스 0.1(Terminal-Bench-Science 0.1)모델별 표준오차는 ±3.5~5점이다. 공개 리더보드에서 클로드 코드 하네스를 사용해 작업당 3회씩 시험한 결과, 클로드 오퍼스 5의 점수는 30.0%로 집계됐다. 앤트로픽의 평가 환경에서는 29.0%로 재현됐으며, 이는 통계적 오차 범위 내에 해당한다. GPT-6 아스트라의 수치는 오픈AI가 공개한 결과를 인용했다.

다만 이 같은 수치는 앤트로픽이 공개한 자체 평가 결과로, 모델별 평가 설정과 보호조치 개입 여부에 따라 실제 성능 및 비용은 달라질 수 있다.

토큰 가격 인하에 작업당 비용까지 절감...출력 속도 30% 향상

오퍼스 5.5의 핵심 경쟁력 가운데 하나는 비용 효율성이다. 앤트로픽은 모델 자체의 토큰당 가격을 낮춘 데 더해, 동일한 작업을 수행하는 데 필요한 토큰 수도 줄여 일반적인 작업 기준 총비용을 오퍼스 5보다 40% 절감했다고 설명했다.

100만 토큰 기준 입력 가격은 4달러, 출력 가격은 20달러로 책정됐다. 전작의 입력 5달러, 출력 25달러보다 각각 20% 낮다.

에이전틱 코딩과 에이전트 작업에서 비중이 큰 캐시 읽기 비용은 100만 토큰당 0.20달러로, 전작의 0.50달러보다 60% 인하됐다. 캐시 쓰기 비용도 6.25달러에서 5달러로 낮아졌다.

출력 생성 속도는 오퍼스 5보다 30% 이상 빨라졌다. 클로드 코드(Claude Code)와 클로드 플랫폼(Claude Platform)에서는 최대 2.5배 빠른 패스트 모드도 제공한다. 다만 패스트 모드 가격은 입력 100만 토큰당 8달러, 출력 100만 토큰당 40달러로 일반 모드보다 높다.

앤트로픽은 프로(Pro), 맥스(Max), 팀(Team), 좌석 기반 엔터프라이즈(Enterprise) 구독 요금제의 5시간 사용 한도도 확대한다. 구독 이용자에게는 사용량 제한 초기화 기능도 제공해, 초기화 시점을 원하는 때에 사용할 수 있도록 했다.

전문 지식 업무·금융 분석에서도 성능 향상

클로드 오퍼스 5.5는 소프트웨어 개발뿐 아니라 기업의 전문 지식 업무와 금융 분석에서도 성능 개선을 보였다고 앤트로픽은 밝혔다. 44개 직종의 실제 업무를 평가하는 GDPval-AA v2.1에서 오퍼스 5.5는 1846 엘로(Elo)를 기록했다. 페이블 5.1은 1735, 오퍼스 5는 1708이었다.

앤트로픽은 기업 실적 보고서 작성 테스트도 진행했다. 모델이 실적 발표 자료를 찾기 어려운 웹 환경에서 기업의 분기 실적 보고서를 작성하도록 하고, 자동 평가 시스템이 모든 수치와 인용문을 원문 출처와 대조하는 방식이다. 수치나 인용을 하나라도 지어내면 품질 기준을 통과하지 못하도록 설계했다.

그 결과 오퍼스 5.5는 서로 다른 추론 노력 설정에서 총 18건 중 16건이 품질 기준을 통과했다. 페이블 5.1과 오퍼스 5는 어떤 시도에서도 해당 기준을 충족하지 못했다.

금융 분석에서는 가상의 인사관리 소프트웨어 기업 두 곳의 합병안을 분석하고, 엑셀 재무 모델과 경영진용 프레젠테이션을 작성하도록 했다. 두 모델은 거래에 대한 결론은 같았지만, 오퍼스 5.5가 더 상세한 재무 모델과 읽기 쉬운 발표 자료를 만들었으며 작업 시간은 63분으로 오퍼스 5의 93분보다 짧았다. 제작 비용도 50% 낮았다.

초기 평가에 참여한 투자회사 월아이 캐피털(Walleye Capital)은 오퍼스 5.5가 낮은 추론 노력 설정에서도 자체 평가 과제 대부분을 해결했다고 밝혔다. 높은 설정에서는 평가 지침의 오류를 찾아내 스스로 수정하기도 했다.

장시간 자율 실행 대비...프롬프트 인젝션 방어 강화

앤트로픽은 오퍼스 5.5를 장시간 자율적으로 작동하는 AI 에이전트에 적합하도록 안전장치도 강화했다고 밝혔다. 기업 환경에서 에이전트가 수 시간 동안 독립적으로 작업할 경우, 지정된 범위를 벗어나거나 의도하지 않은 동작을 수행하는 위험을 관리해야 한다는 설명이다.

오퍼스 5.5에는 실행 전 에이전트의 각 동작을 검사하는 분류기, 보안팀이 감사할 수 있는 오픈소스 샌드박스, 코드 병합 전 취약점을 탐지하는 코드 리뷰 기능 등이 적용됐다.

모델 자체의 프롬프트 인젝션 방어 능력도 개선됐다. 앤트로픽은 코딩, 도구 사용, 컴퓨터 활용, 웹 브라우징 등 모든 시험 환경에서 오퍼스 5.5가 오퍼스 5와 같거나 더 나은 방어 성능을 보였다고 밝혔다.

AI 보안 기업 그레이 스완(Gray Swan)의 벤치마크에서는 페이블 5.1과 함께 시험 모델 가운데 가장 낮은 프롬프트 인젝션 성공률을 기록했다.

자체 자동화 행동 감사에서는 거의 2000개 시나리오를 대상으로 정렬 성능을 평가했다. 오퍼스 5.5는 대부분의 비정렬 행동 측정 항목에서 최근 클로드 모델보다 높은 성능을 기록했으며, 정직성 관련 평가에서도 다수 항목에서 자체 최고 성능을 보였다.

특히 모델이 실행 환경의 격리 경계를 벗어나려는 시도를 측정한 신규 평가에서 오퍼스 5.5의 경계 우회 시도는 오퍼스 5나 클로드 미토스 5.1보다 약 85% 적었다. 발생한 시도도 모두 낮은 심각도였으며, 모델이 해당 시도를 자체 보고했다고 앤트로픽은 설명했다.

다만 앤트로픽은 모델이 평가받고 있다는 사실을 추측하는 징후가 관찰됐다고 밝혔다. 실제 배포 환경에서 나타날 수 있는 모든 실패를 사전에 포착하는 평가 체계를 구축하는 것은 여전히 해결되지 않은 과제라는 설명이다.

생물학·사이버보안 고위험 작업은 별도 검증 프로그램으로 관리

오퍼스 5.5는 생물학과 사이버보안 분야에서도 클로드 미토스 5.1과 비교할 만한 역량을 갖춘 것으로 평가돼, 앤트로픽의 고성능 모델인 페이블 5.1과 유사한 보호조치가 적용된다.

사이버보안 분야에서는 일반적인 소프트웨어 개발 과정에서 취약점을 식별하고 수정하는 작업은 지원하지만, 대부분의 사이버보안 작업은 보호조치에 따라 클로드 오퍼스 4.8로 전환된다.

앤트로픽은 향후 수 주 내 사이버 검증 프로그램(Cyber Verification Program)을 확대해 검증된 사이버보안 전문가에게 오퍼스 5.5를 제공할 계획이다. 프로그램은 단계별로 접근 권한을 차등화하며, 클로드 미토스 모델에 대한 접근도 포함할 예정이다.

생물학 분야에서는 오퍼스 5.5가 오퍼스 5를 능가하고, 여러 작업에서 미토스 5.1과 비슷하거나 더 높은 역량을 보였다고 밝혔다. 다이노 테라퓨틱스(Dyno Therapeutics)와 공동 진행한 장기 분자 예측·설계 평가에서도 개선이 확인됐으며, 전문가 레드팀은 과학적 참신성이 시험한 최고 수준 모델과 비슷하다고 평가했다.

이에 따라 앤트로픽은 생명과학 검증 프로그램(Life Sciences Verification Program)을 통해 학술 연구소, 스타트업, 제약회사 등 검증된 기관에 생물학 연구개발용 접근 권한을 제공한다.

모델의 추론 능력을 대규모로 추출하는 증류 공격에 대응하기 위한 보호조치도 적용됐다. 오퍼스 5.5는 페이블 5.1에 도입된 '보존된 사고(Preserved Thinking)' 기능을 탑재했다. 이는 API 사용자가 클로드의 이전 문맥을 편집해 추론 과정을 추출하려는 시도를 차단하는 방식이다. 해당 조치는 2026년 8월 31일 이후 생성된 API 계정의 오퍼스 5.5와 페이블 5.1에 적용된다.

이 밖에 오퍼스 5.5는 기존 오퍼스 모델과 마찬가지로 데이터 보존 제로(ZDR)를 지원하며, EU AI법 준수를 위한 워터마킹 조치도 적용됐다. 추론 기능을 끈 상태로는 더 이상 제공되지 않는다.

클로드 5.5 패밀리 확장... 주요 클라우드 플랫폼서 이용 가능

클로드 오퍼스 5.5는 클로드 플랫폼을 비롯해 아마존웹서비스(AWS), 구글 클라우드(Google Cloud), 마이크로소프트 애저(Microsoft Azure) 등에서 이용할 수 있다. 개발자는 클로드 플랫폼에서 claude-opus-5-5 모델을 통해 사용할 수 있다.

앤트로픽은 앞으로 수 주 내 클로드 소넷 5.5(Claude Sonnet 5.5)와 클로드 하이쿠 5.5(Claude Haiku 5.5)도 출시할 계획이다. 두 모델에도 성능과 효율성, 안전성 개선 사항이 상당 부분 적용될 예정이다.

클로드 오퍼스 5.5의 핵심은 단순히 더 높은 벤치마크 점수를 기록했다는 데 있지 않다. 대규모 코드 마이그레이션과 기업 분석처럼 실제 업무에 가까운 작업에서 토큰 사용량과 실행 시간을 줄이고, 이를 통해 AI 에이전트의 운영비까지 낮추는 방향을 제시했다는 점이다.

특히 AI 에이전트가 여러 도구를 호출하며 장시간 업무를 수행하는 환경에서는 모델의 성능뿐 아니라 작업당 비용과 오류 복구 부담이 기업 도입의 주요 변수가 된다. 앤트로픽이 강조한 40% 비용 절감이 실제 기업 환경에서도 재현된다면, 고성능 AI 모델의 활용 범위와 경제성을 평가하는 기준에도 영향을 줄 수 있다.

다만 이번에 공개된 성능 및 비용 수치는 상당 부분 앤트로픽의 자체 평가와 초기 고객 사례에 기반한다. 실제 기업 환경에서의 효과는 업무 유형과 시스템 구성, 안전장치 개입 빈도에 따라 달라질 수 있다. 고위험 분야의 접근 제한과 검증 프로그램 역시 모델의 역량 확대가 곧바로 무제한적인 활용으로 이어지지 않는다는 점을 보여준다.

앤트로픽이 프런티어 AI 개발 속도 조절을 강조하면서 성능 향상과 안전성 평가를 함께 내세운 가운데, 향후 관건은 이러한 보호조치가 실제 배포 환경에서도 얼마나 일관되게 작동하는지, 그리고 비용 효율성 개선이 기업의 생산성 향상으로 이어지는지를 입증하는 데 있다.

원문의 저작권은 출처에 있습니다.출처에서 원문 보기 새 창에서 열림