xAI Grok 4.6, Amazon Bedrock에서 사용 가능

xAI Grok 4.6, Amazon Bedrock에서 사용 가능

에이전트를 돌려본 팀이라면 추론 토큰이 청구서에서 별도 항목이 된다는 걸 이미 겪었을 겁니다. 여러 단계를 거치며 스스로 검증하고 다시 계획을 세우는 작업일수록 토큰이 빠르게 쌓입니다. 여기서 결정할 게 두 가지입니다. 어떤 모델을 얼마나 깊게 추론시킬 것인가, 그리고 그 호출을 어느 엔드포인트와 리전으로 보낼 것인가. xAI의 Grok 4.6이 2026년 8월 18일 Amazon Bedrock에 올라오면서 이 선택지가 늘었습니다.

Grok 4.6은 xAI가 Bedrock에 올린 두 번째 모델입니다. 앞서 Grok 4.3이 정식 출시될 때 xAI는 OpenAI 호환 추론 엔진인 Bedrock Mantle을 통해서만 접근할 수 있었습니다. 4.6은 그 범위를 넓혀 bedrock-mantle과 bedrock-runtime 두 엔드포인트에서 모두 제공됩니다. Converse API도 Chat Completions, Responses API와 함께 쓸 수 있습니다.

무엇을 잘하도록 만들어졌나

xAI는 Grok 4.6을 장시간 실행되는 에이전트, 코딩, 지식 작업을 겨냥해 만들었다고 설명합니다. 주제를 조사하거나 정보를 분석하고, 코드베이스 전반을 오가거나 아이디어를 완성된 애플리케이션으로 다듬는 것처럼 여러 단계에 걸친 복잡한 작업을 이어가는 데 초점을 뒀습니다.

에이전트를 만드는 입장에서 눈여겨볼 동작이 두 가지 있습니다. 긴 작업 흐름에서 모델이 다음 단계로 넘어가기 전에 자기 작업을 점검하는 자기 검증 행동을 더 많이 보였습니다. 또 시각적이고 상호작용이 필요한 프로젝트에서 첫 결과물의 완성도가 높아, 애플리케이션의 구조와 시각적 틀을 한 번에 잡아냅니다.

출시 시점에 xAI가 공개한 벤치마크에서 Grok 4.6 High는 AA Intelligence Index 61, AA-Briefcase 1577 등을 기록했습니다. 이 수치 가운데 다수는 Artificial Analysis의 평가에서 나온 것으로, 에이전트 도구 사용, 추론과 지식, 긴 문맥 추론, 스프레드시트와 문서에 대한 정량 분석 등을 측정합니다.

엔드포인트에 따라 쓸 수 있는 기능이 갈립니다

통합 방식을 가르는 핵심은 어느 엔드포인트를 쓰느냐입니다. 모델 ID부터 다릅니다. bedrock-mantle에서는 xai.grok-4.6을, bedrock-runtime에서는 교차 리전 추론 프로파일인 us.xai.grok-4.6 또는 global.xai.grok-4.6을 지정합니다.

bedrock-mantle은 클라이언트 측 도구 호출, 추론, 구조화된 출력, 프롬프트 캐싱, 응답 스트리밍을 지원합니다. bedrock-runtime은 추론, 프롬프트 캐싱, 응답 스트리밍, 호출 로깅을 지원하지만 구조화된 출력, 서버 측 도구 사용, 지능형 프롬프트 라우팅, 애플리케이션 추론 프로파일은 지원하지 않습니다. 도구 호출 자체는 양쪽 모두 됩니다.

기준은 단순합니다. JSON Schema 기반 구조화된 출력이 필요하면 bedrock-mantle을 봐야 합니다. Converse API나 호출 로깅을 원하면 bedrock-runtime입니다. Grok 4.6은 텍스트와 이미지를 입력받아 텍스트를 반환합니다. 오디오, 음성, 비디오, 임베딩은 지원하지 않고 이미지도 생성하지 않습니다. Invoke API도 지원하지 않습니다.

Converse를 쓰면 여러 모델에 같은 메시지 형식을 쓰고, messageStart, contentBlockDelta, messageStop 같은 표준 이벤트로 스트리밍을 받습니다. SSE 파싱을 직접 짤 필요가 없습니다.

리전과 교차 리전 추론

가용 리전도 엔드포인트마다 다릅니다. bedrock-mantle에서는 US West(Oregon), us-west-2에서 인-리전 추론이 가능합니다. bedrock-runtime에서는 인-리전 추론을 제공하지 않고 교차 리전 프로파일로 호출합니다. Geo 프로파일은 미국 리전(us-east-1, us-east-2, us-west-1, us-west-2)에서 호출할 수 있고, 데이터 레지던시 요건이 있을 때 트래픽을 미국 지역 안에 유지합니다. Global 프로파일은 미국, 캐나다, 유럽, 아시아 태평양, 중동, 아프리카, 남미를 아우르는 30개 넘는 리전에서 호출할 수 있고 전 세계로 라우팅합니다.

두 프로파일은 요금도 다릅니다. Global이 입력 100만 토큰당 2.00달러로, Geo의 2.20달러보다 저렴합니다. 레지던시 제약이 없다면 Global이 기본값으로 무난합니다. 정확한 리전 목록은 모델 카드와 Regional availability by model 페이지에서 확인할 수 있습니다.

비용을 움직이는 지렛대

토큰 요금은 xAI 기준으로 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러부터 시작하고 빠른 변형은 그 두 배입니다. Bedrock의 실제 요율과 티어별 가격은 Amazon Bedrock 요금 페이지에서 확인해야 합니다.

세 가지 서비스 티어가 있습니다. Standard는 약정 없는 종량제이고, "service_tier" 필드를 생략하거나 "default"로 두면 선택됩니다. Priority는 표준 요율의 1.75배로 우선 처리를 제공하고, Flex는 0.5배로 시간에 민감하지 않은 작업에 씁니다. 같은 워크로드가 인-리전 Standard에서 입력 100만 토큰당 2.20달러라면 Priority에서는 3.85달러, Flex에서는 1.10달러입니다. 티어 선택이 리전 선택보다 비용에 더 큰 영향을 줍니다.

프롬프트 캐싱도 있습니다. 캐시된 입력은 표준 입력 요율의 약 4분의 1로 청구됩니다. 매 턴마다 큰 시스템 프롬프트나 문서를 다시 보내는 에이전트라면 차이가 큽니다. 캐싱은 반복되는 접두부에 적용되므로 변하지 않는 내용을 요청 앞쪽에 두고, usage 블록의 캐시 토큰 수를 읽어 할인이 실제로 적용되는지 확인한 뒤 비용 모델에 넣는 게 좋습니다.

추론 노력 수준은 low, medium, high, xhigh 네 단계입니다. Grok 4.3 시절의 none, low, medium, high에서 상단에 xhigh가 추가됐습니다. 추론이 기본으로 켜져 있고 노력 수준을 요청마다 정하므로, 이 값이 곧 비용과 지연 조절 장치입니다. 짧은 추출·분류 호출은 low로 돌리고, 초반 실수가 뒤로 누적되는 계획 단계나 긴 에이전트 흐름에만 high나 xhigh를 씁니다. Converse에서는 추론 파라미터가 아니라 additionalModelRequestFields={"reasoning_effort": "xhigh"}로 설정합니다.

무인 실행에 붙이는 통제 장치

에이전트가 여러 단계를 감독 없이 도는 경우, bedrock-runtime에서 Amazon Bedrock Guardrails를 붙일 수 있습니다. 콘텐츠 필터, 금지 주제, 개인식별정보(PII) 삭제, 단어 정책을 프롬프트와 모델 응답 양쪽에 평가합니다. 가드레일은 ID와 버전으로 요청에 연결합니다.

호출 로깅을 켜면 Grok 4.6 호출이 Amazon CloudWatch에 완전한 레코드로 남습니다. 요청 본문, 응답 본문, 추론 토큰을 포함한 토큰 수, 사용한 추론 프로파일까지 기록되므로, 모델에 실제로 무엇을 물었는지 감사해야 하는 에이전트 실행에 쓸 수 있습니다.

인증은 코드 경로에 따라 두 방식입니다. OPENAI_API_KEY에 넣은 Bedrock API 키는 bearer 토큰으로 전달되어 OpenAI 호환 호출을 인증합니다. boto3 Converse 예제는 SigV4로 서명하며 일반 AWS 자격 증명을 씁니다. 두 API를 함께 쓸 계획이면 둘 다 설정해야 합니다. bedrock:InvokeModel은 기본 프로젝트, 호출하는 추론 프로파일, 기반 모델 세 리소스에 대해 평가되고, bearer 토큰 인증에는 bedrock:CallWithBearerToken이 추가로 필요합니다. 프로파일은 개별로 범위가 잡히므로 us.xai.grok-4.6을 지정한 정책은 global.xai.grok-4.6을 포함하지 않습니다.

탐색용으로 만든 장기 API 키는 탐색에만 쓰고, 프로덕션에서는 aws-bedrock-token-generator로 IAM 자격 증명에서 생성한 단기 bearer 토큰을 쓰는 방식이 권장됩니다. 단기 토큰은 자동 만료되고 접근이 IAM 신원에 묶입니다. 탐색이 끝난 장기 키는 Bedrock 콘솔에서 삭제해 둡니다.

시작하려면 Grok 4.6 모델 카드에서 현재 리전 목록, 기능 매트릭스, 파라미터 세부 사항을 확인하고, 토큰 요율은 Amazon Bedrock 요금 페이지에서 확인할 수 있습니다.

실무 판단

(솔트웨어 아키텍트의 판단입니다)

지금 손대야 하는 팀은 이미 Bedrock 위에서 다단계 에이전트나 코드 지원 워크로드를 돌리고 있고, 추론 토큰이 청구서에서 눈에 띄는 항목이 된 곳입니다. 기존 모델과 Converse 메시지 형식을 공유하므로 모델 ID와 추론 프로파일만 바꿔 A/B로 비교해볼 수 있습니다. 비교의 초점은 성능보다 토큰당 결과 품질입니다. 같은 작업을 low와 high로 각각 돌려 어느 지점에서 추가 추론이 토큰 값을 못 하는지 자기 워크로드로 재보는 게 가장 빠릅니다.

이번에는 넘겨도 되는 팀은 단순 챗봇이나 짧은 추출·분류만 돌리는 곳, 그리고 아직 특정 모델에 대한 성능 불만이 없는 곳입니다. 500K 문맥과 xhigh 추론은 긴 에이전트 흐름에서 값을 하는 기능이라, 단발성 짧은 호출 위주라면 지금 모델을 교체할 이유가 약합니다.

작업 규모는 이미 OpenAI 호환 클라이언트나 Converse를 쓰고 있다면 초기 연동과 비교 테스트에 반나절 정도입니다. 가드레일 연결과 IAM 정책에서 추론 프로파일별 리소스를 나눠 잡는 작업, 프롬프트 캐싱이 실제로 걸리는지 usage로 확인하는 작업까지 포함하면 하루로 잡는 게 안전합니다. 구조화된 출력을 쓰고 있었다면 bedrock-runtime에서 지원되지 않으므로 엔드포인트 선택에서 한 번 더 검토가 필요합니다.

비용 방향은 선택에 달렸습니다. 티어가 리전보다 큰 지렛대입니다. Flex(0.5배)로 돌릴 수 있는 비동기 작업을 Priority(1.75배)로 밀면 같은 토큰에 세 배 넘게 차이가 납니다. 레지던시 제약이 없다면 Global 프로파일이 Geo보다 입력 토큰당 저렴하고, 반복되는 시스템 프롬프트가 크다면 프롬프트 캐싱으로 입력 요율을 4분의 1까지 낮출 수 있습니다. 반대로 추론을 기본 켜둔 채 노력 수준을 방치하면 토큰이 조용히 늘어납니다.

출처: xAI's Grok 4.6 is now available in Amazon Bedrock


원문: xAI’s Grok 4.6 is now available in Amazon Bedrock · 발행일 2026-09-21

관련 글

Grok 4.3, Amazon Bedrock에서 정식 제공 시작2026-07-16AWS 위클리 라운드업 정리: 뉴욕 서밋, 하노이 로컬 존, Bedrock의 Grok 4.32026-06-22Grok 4.3, Amazon Bedrock에서 사용 가능2026-06-16Amazon Bedrock 프롬프트 캐싱으로 입력 토큰 비용과 지연 시간 줄이기2026-09-15
전체 글 보기 →
AWS·Anthropic·Databricks AI·데이터 소식, 발표 당일 한국어 분석으로

새로운 AI 서비스가 나올 때마다 실무 관점 분석을 메일로 보내드립니다. 무료이며 언제든 해지할 수 있습니다.

이 소식 도입 상담하기 →