Moonshot AI Kimi K3, Amazon Bedrock에서 정식 출시
코드 리뷰 도구나 사내 문서 검색에 LLM을 붙여 두면, 같은 컨텍스트를 반복해서 모델에 넣는 상황이 자주 생깁니다. 큰 저장소를 통째로 물려서 여러 번 질문하거나, 긴 프롬프트 앞부분이 매 호출마다 똑같은 경우입니다. 그때마다 입력 토큰이 새로 계산되면 비용과 지연이 같이 늘어납니다. Amazon Bedrock에 정식 출시된 Moonshot AI의 Kimi K3는 이 지점을 겨냥한 기능을 하나 들고 나왔습니다.
Kimi K3가 제공하는 것
Moonshot AI는 Kimi K3를 자사에서 가장 성능이 높은 모델로 소개하며, 오픈 모델 중 처음으로 2.8조(2.8 trillion) 파라미터에 도달했다고 밝힙니다. 네이티브 비전 기능과 100만(1-million) 토큰 컨텍스트 윈도우를 함께 갖췄습니다. 이 조합 덕분에 큰 저장소를 다루는 긴 코딩 세션, 스캔된 페이지나 스크린샷을 포함한 다중 문서 분석, 오래 이어지는 에이전트 워크플로에 쓸 수 있습니다.
Moonshot AI는 Kimi K2 대비 스케일링 효율이 약 2.5배 개선됐다고 보고합니다.
프롬프트 캐싱과 보안 경계
Kimi K3는 Amazon Bedrock의 오픈 웨이트 모델 가운데 처음으로 명시적 프롬프트 캐싱(explicit prompt caching)을 지원합니다. 여러 번의 모델 호출에서 같은 컨텍스트를 재사용할 때, 이 기능이 지연과 입력 비용을 줄여 줍니다. 앞서 말한 반복 컨텍스트 상황에 직접 대응하는 기능입니다.
Amazon Bedrock 안에서 Kimi K3는 자체 개발 모델과 동일한 보안 경계 안에서 실행됩니다. 접근 제어, 암호화, 감사 로깅도 다른 모델과 같은 방식으로 적용됩니다. 이미 Bedrock에서 다른 모델을 운영하고 있다면, 거버넌스 설정을 따로 다시 짤 필요 없이 같은 틀 안에서 오픈 웨이트 모델을 추가하게 됩니다.
사용 가능한 리전과 시작 방법
Kimi K3는 Amazon Bedrock을 사용할 수 있는 모든 AWS 리전에서 교차 리전 추론(cross-Region inferencing)을 통해 제공됩니다. Amazon Bedrock 콘솔에서 바로 시작할 수 있고, 자세한 내용은 Amazon Bedrock 문서와 출시 블로그에서 확인할 수 있습니다.
실무 판단
(솔트웨어 아키텍트의 판단입니다)
지금 손대야 하는 팀은 이미 Bedrock에서 코딩 보조나 에이전트, 문서 분석 워크로드를 돌리고 있고, 긴 컨텍스트를 반복해서 넣느라 입력 토큰 비용이 눈에 띄게 쌓이는 팀입니다. 프롬프트 캐싱은 코드나 아키텍처 변경 없이 설정만으로 반복 컨텍스트의 입력 비용을 낮출 수 있는 수단이라, 이런 팀은 캐싱 적용 여부를 우선 점검할 값어치가 있습니다. 스캔 문서나 스크린샷을 다루는 워크로드가 있다면 비전 기능도 같이 검토 대상입니다.
이번에는 넘겨도 되는 팀은 LLM 호출량이 적거나 컨텍스트가 매번 짧게 달라져 캐싱 효과를 보기 어려운 곳, 그리고 지금 쓰는 모델로 품질과 비용에 불만이 없는 곳입니다. 파라미터 수와 컨텍스트 윈도우가 크다는 것만으로 모델을 바꿀 이유는 되지 않습니다.
예상 작업 규모는 반나절 정도입니다. 콘솔에서 모델 접근을 활성화하고, 기존 프롬프트 흐름에 캐싱을 붙여 실제 워크로드로 지연과 입력 비용을 A/B로 비교하는 수준입니다.
비용 방향은 두 갈래입니다. 반복 컨텍스트가 많은 워크로드라면 프롬프트 캐싱으로 입력 비용이 내려갈 수 있습니다. 다만 2.8조 파라미터 모델의 토큰 단가와 캐싱 요금은 원문에 나와 있지 않으므로, 전환 전에 Amazon Bedrock 공식 문서의 요금표로 현재 쓰는 모델과 단가를 대조한 뒤 판단하시길 권합니다.
원문: Kimi K3 by Moonshot AI is now generally available on Amazon Bedrock · 발행일 2026-09-18