Claude Opus 5 출시: Opus 등급의 성능 향상과 안전장치 변경 사항

Claude Opus 5 출시: Opus 등급의 성능 향상과 안전장치 변경 사항

Anthropic이 2026년 7월 24일 Claude Opus 5를 공개했습니다. 오늘부터 모든 플랫폼에서 사용할 수 있습니다. Opus 등급에서 상위 모델인 Claude Fable 5의 지능에 근접하면서 가격은 그 절반 수준이라는 점이 이번 모델의 위치를 잘 보여줍니다. 코딩과 지식 작업 평가인 Frontier-Bench, GDPval-AA에서 최고 성능을 기록했고, 다만 사이버보안 작업에서는 Mythos 5보다 뒤에 있습니다.

Opus 5는 Claude Max의 새 기본 모델이자 Claude Pro에서 가장 강력한 모델로 자리 잡았습니다. 매일 반복적으로 쓰도록 설계된 모델이며, 다른 모델보다 효율적으로 동작합니다.

성능과 비용 효율

Opus 5는 이전 모델인 Opus 4.8과 동일한 가격에 성능을 크게 끌어올렸습니다. 여기서 핵심은 effort 설정입니다. 고객이 지능을 우선할지, 토큰을 아껴 더 빠르고 저렴한 결과를 얻을지를 이 설정으로 조절할 수 있습니다.

소프트웨어 엔지니어링 작업에서의 결과가 두드러집니다. Frontier-Bench v0.1에서 Opus 5는 다른 모든 모델을 앞섰고, 작업당 비용은 더 낮으면서 Opus 4.8 대비 성능을 두 배 이상 냈습니다. CursorBench 3.2에서는 max effort 기준으로 Fable 5의 최고 점수와 0.5% 이내 차이까지 접근했는데, 작업당 비용은 절반입니다. high, xhigh, max effort 구간에서 주어진 비용 대비 성능이 다른 모든 모델보다 높았습니다.

지식 작업과 문제 해결에서도 비슷한 양상이 나타납니다.

  • ARC-AGI 3: 새로운 문제를 풀어야 하는 평가에서 차순위 모델의 세 배 점수를 기록
  • Zapier AutomationBench: 업무를 처음부터 끝까지 완수하는지를 보는 평가에서, 같은 작업당 비용으로 차순위 모델의 약 1.5배 통과율. 가장 낮은 effort 설정에서도 다른 어떤 모델보다 많은 작업을 통과
  • OSWorld 2.0: 컴퓨터 사용 벤치마크에서 주어진 비용 대비 모든 모델을 앞섰고, Fable 5의 최고 결과를 그 3분의 1을 조금 넘는 비용으로 넘어섬

과학 연구에서는 Opus 4.8 대비 유의미하게 나아졌습니다. 구조생물학, 유기화학, 생명정보학 등을 포함한 생명과학 평가 전 항목에서 Opus 4.8을 앞섰습니다. 향상 폭이 가장 큰 곳은 유기화학 쪽으로, 분광 데이터에서 분자 구조를 추론하는 작업에서 내부 벤치마크 기준 Opus 4.8보다 10.2%포인트 높은 점수를 냈습니다. 단백질 서열 변이가 기능에 미치는 영향을 예측하는 작업에서는 7.7%포인트 높았습니다.

시각적 출력물도 강화됐습니다. 공기역학적 물체와 그렇지 않은 물체 위로 흐르는 공기를 시각화하거나, 세포를 단순화한 인터랙티브 도해를 만드는 사례가 있습니다.

스스로 검증하고 반복하는 동작

Opus 5는 자기 작업을 검증하고 성공할 때까지 조심스럽게 반복하는 능력이 강해졌습니다. 초기 접근 테스트에서 나온 사례 몇 가지가 이 성격을 잘 드러냅니다.

한 Frontier-Bench 작업에서는 기계 부품 도면을 주고 이를 3D FreeCAD 모델로 재구성하는 코드를 작성하도록 했습니다. 이때 모델이 도면을 직접 볼 수단을 의도적으로 주지 않았습니다. Opus 5는 자체 컴퓨터 비전 파이프라인을 작성해 원본 픽셀에서 형상을 추출한 뒤 부품 전체를 재구성했고, 이를 반복적으로 성공시켰습니다. 동일한 환경에서 다른 모델은 다섯 번 시도해도 풀지 못했습니다.

널리 쓰이는 오픈소스 패키지 관리자의 실제 버그를 다룬 사례에서는 근본 원인을 찾아, 커뮤니티 패치가 놓친 엣지 케이스까지 수정했습니다. 비교 대상 모델은 표면 증상만 고치고 버그가 해결됐다고 보고했습니다.

한 트레이딩 회사 엔지니어는 새 거래소의 마켓 데이터 피드를 단일 세션에서 구축하는 데 Opus 5를 썼습니다. 이전 모델들은 상세한 계획을 줘도 이 작업을 전혀 끝내지 못했습니다. Opus 5는 검증에 쓸 라이브 피드가 없자, 코드가 거래소 데이터를 올바르게 파싱하는지 확인하는 테스트 하네스를 직접 만들었습니다.

초기 접근 고객들의 보고에서도 비슷한 특성이 반복됩니다. Box는 Opus 5가 Opus 4.8보다 8% 앞섰고, 데이터 분석 워크플로에서 11%, 실사(due diligence) 워크플로에서 17% 향상을 확인했다고 전했습니다. 한 금융 모델링 작업에서는 effort 수준 전반에 걸쳐 평균 9%포인트 높은 정확도를 냈고, 턴과 도구 호출은 3분의 1 적었으며 소요 시간은 60% 줄었습니다. 법률 에이전트 작업에서는 max reasoning 기준 Opus 4.8 대비 평균 26% 적은 토큰으로 유사한 성능을 유지했습니다.

정렬과 안전

배포 전 자동 행동 감사에서 Opus 5는 지금까지 나온 모델 중 가장 정렬이 잘 된 모델로 나타났습니다. Claude's Constitution을 Opus 4.8, Sonnet 5, Fable 5보다 잘 준수하고, 기만적 행동 비율이 가장 낮으며, 오용 유도에 가장 덜 취약합니다. 되돌리기 어려운 부작용을 낳을 수 있는 무모한 행동을 피하는 면에서도 가장 안전합니다. 자동 행동 감사에서 전반적 오정렬 행동 점수는 2.3으로 최근 모델 중 가장 낮았습니다.

위험한 이중 용도 역량에서는 프런티어를 밀어 올리지 않았습니다. 민간과 정부 파트너와 함께 진행한 평가에서 생물학 연구와 공격적 사이버보안 모두 Mythos 5보다 뒤에 있는 것으로 확인됐습니다. 자세한 내용은 Anthropic의 System Card에서 볼 수 있습니다.

Opus 4.8과 마찬가지로 Opus 5는 사이버 작업으로 학습시키지 않았습니다. 그럼에도 전반적 역량이 높아지면서 이 작업에서도 상당히 향상됐고, 사이버보안 취약점을 찾아내는 면에서는 Mythos 5에 근접합니다. 다만 그 취약점을 익스플로잇으로 전환하는, 즉 실제 사이버 위협으로 만드는 면에서는 여전히 Mythos 5보다 크게 뒤처집니다. OSS-Fuzz 평가에서 취약점 식별은 Mythos 5와 비슷한 성공률을 보였지만 익스플로잇 개발 점수는 훨씬 낮았습니다.

Opus 5의 안전장치와 폴백 동작

Opus 5의 안전장치는 사이버보안과 생물학 양쪽에서 유익한 사용을 허용하도록 설계됐습니다. 대체로 Opus 4.8과 유사하고, 좁은 범위의 사이버 작업에 대해서만 더 강한 가드레일이 적용됩니다.

사이버보안 분류기는 Fable 5의 것보다 상대적으로 덜 제한적입니다. 소스 코드에서 취약점을 찾는 작업은 허용하고, 악의적 행위자와 더 연관되는 방식인 바이너리 기반 취약점 스캔, 침투 테스트, 익스플로잇 생성은 차단합니다. 테스트를 근거로 이 분류기는 Fable 5보다 약 85% 적게 개입할 것으로 예상됩니다.

플래그된 요청의 처리 방식은 표면에서 눈여겨볼 부분입니다. Claude.ai, Claude Code, Claude Cowork에서 플래그된 요청은 기본적으로 Opus 4.8로 폴백됩니다. API에서도 Opus 4.8 폴백을 켤 수 있습니다.

diagram

안전장치 때문에 막히는 사이버보안 작업을 위해 Cyber Verification Program(CVP)이 운영됩니다. 이미 CVP에 속한 기업과 연구자는 보안 제한이 완화된 버전의 Opus 5에 즉시 접근할 수 있습니다.

생물학 쪽에서는 Opus 4.8과 유사한 안전장치를 갖췄기 때문에, Opus 5는 일반적으로 사용 가능한 모델 중 과학 연구에 가장 유능한 모델이 됐습니다. 다만 장시간 자율 연구 작업에는 여전히 중요한 한계가 있고, 이 유형에서는 Mythos 5가 더 강한 모델로 남아 있습니다. 이번 출시에 맞춰, Fable 5에서 차단되던 생물학 관련 요청은 이제 Opus 4.8이 아니라 Opus 5로 라우팅됩니다.

도입 전 확인할 사실

가격은 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러로 Opus 4.8과 동일합니다. 개발자는 Claude API에서 claude-opus-5로 시작할 수 있습니다.

Fast 모드도 제공됩니다. 기본 속도의 약 2.5배로 동작하며, Claude Platform에서는 Opus 5 기본 가격의 두 배, Claude Code에서는 사용 크레딧으로 이용할 수 있습니다.

Opus 5와 함께 두 가지 베타 기능이 나왔습니다.

  • 대화 중 도구 변경(Claude Platform): 대화 진행 중에 Claude가 사용할 수 있는 도구를 바꿔도 프롬프트 캐시가 무효화되지 않습니다.
  • 자동 폴백(API): Opus 5 또는 Fable 5의 안전 분류기가 플래그한 요청을 다른 모델로 자동 라우팅하도록 선택할 수 있습니다. 자동 폴백을 켜면 API 요청이 차단되는 대신 기본적으로 사용 가능한 최선의 모델로 라우팅됩니다.

이전 Opus 모델과 마찬가지로 일반 접근에는 데이터 보존 요구 사항이 없습니다.

effort 설정과 Fast 모드처럼 비용과 속도에 직접 영향을 주는 옵션이 여러 개이므로, 워크로드별로 어떤 조합이 적합한지는 실제 작업 특성에 따라 달라집니다. 모델 활용에 대한 세부 지침은 Anthropic의 prompting guide에서, 안전 평가 관련 상세 내용은 System Card에서 확인할 수 있습니다.


원문: Introducing Claude Opus 5 · 발행일 2026-07-24

관련 글

Claude Fable 5, AWS에서 정식 출시된 첫 Mythos급 모델2026-06-11Claude Sonnet 5, Amazon Bedrock과 Claude Platform on AWS에서 사용 가능2026-06-30Claude Fable 5, Amazon Bedrock과 Claude Platform on AWS에서 사용 가능2026-06-11Claude apps gateway for AWS: Claude Code와 Claude Desktop을 위한 자체 호스팅 제어 계층2026-07-08
전체 글 보기 →
AWS·Anthropic·Databricks AI·데이터 소식, 발표 당일 한국어 분석으로

새로운 AI 서비스가 나올 때마다 실무 관점 분석을 메일로 보내드립니다. 무료이며 언제든 해지할 수 있습니다.

이 소식 도입 상담하기 →