Kimi K3는 Moonshot AI가 2026년 7월 16일 공개한 2.8조 파라미터급 멀티모달 AI 모델입니다. 최대 1,048,576토큰의 문맥을 처리하며, 장시간 코딩·자료 조사·문서와 데이터 분석처럼 여러 단계를 이어가는 작업에 초점을 맞췄습니다. 전체 모델 가중치는 7월 27일까지 공개될 예정이므로 현재 이용 가능한 API와 향후 오픈웨이트 배포는 구분해서 봐야 합니다.
최근 AI 커뮤니티에서 Kimi K3가 빠르게 주목받고 있습니다. 다만 공식 발표일은 7월 16일이고, 이후 외부 평가와 리더보드 결과가 이어지면서 다시 화제가 된 흐름입니다. 이 글에서는 공식 기술 블로그와 API 문서, 독립 평가 자료를 기준으로 Kimi K3의 사양, 가격, 성능, 이용 방법과 확인할 점을 정리했습니다.
Kimi K3 핵심 사양은?
| 항목 | 확인된 내용 |
|---|---|
| 개발사 | Moonshot AI |
| 공식 발표일 | 2026년 7월 16일 |
| 전체 파라미터 | 2.8조(2.8T) |
| 구조 | Mixture of Experts, 896개 전문가 중 16개 활성화 |
| 문맥 길이 | 최대 1,048,576토큰(약 100만 토큰) |
| 입력 | 텍스트·이미지, 공식 설명상 네이티브 비전 및 멀티모달 작업 지원 |
| 주요 용도 | 장시간 코딩, 지식 업무, 리서치, 도구 호출, 시각 작업 |
| 가중치 공개 일정 | 2026년 7월 27일까지 공개 예정 |
여기서 2.8조는 매 요청마다 모든 파라미터를 동시에 쓰는 구조를 뜻하지 않습니다. Kimi K3는 MoE 방식을 사용해 896개 전문가 중 16개를 선택적으로 활성화합니다. 큰 모델 규모와 실제 추론 비용을 같은 의미로 해석하면 안 되는 이유입니다.
Kimi K3에서 달라진 핵심 4가지
1. 100만 토큰 문맥
공식 API 문서의 컨텍스트 윈도우는 1,048,576토큰입니다. 긴 보고서 여러 개, 대규모 코드 저장소, 장시간 에이전트 작업 기록처럼 한 번에 다뤄야 할 자료가 많은 업무에 유리합니다. 다만 문맥이 길어질수록 입력 비용과 처리 시간도 늘 수 있어, 모든 작업에 100만 토큰을 채우는 방식은 효율적이지 않습니다.
2. 장시간 코딩과 도구 사용
Moonshot AI는 K3를 짧은 코드 자동완성보다 여러 시간 동안 이어지는 엔지니어링 작업에 맞춘 모델로 소개합니다. 대규모 저장소 탐색, 터미널 도구 실행, GPU 커널 최적화, 화면을 확인하며 프론트엔드나 게임을 수정하는 작업이 대표 사례입니다. API에서는 Tool Calls, JSON Mode, JSON Schema 기반 구조화 출력, 도구 선택 제약 등을 지원합니다.
3. 네이티브 멀티모달
K3는 텍스트뿐 아니라 이미지를 입력으로 받아 시각 정보와 코드를 함께 처리할 수 있습니다. 공식 사례에는 스크린샷을 확인하며 화면을 반복 개선하거나, 연구 결과를 인터랙티브 차트와 대시보드로 만드는 작업이 포함돼 있습니다. 다만 공식 홍보 사례는 통제된 조건에서 나온 결과일 수 있으므로 실제 업무에서는 작은 범위의 테스트부터 시작하는 편이 안전합니다.
4. 새로운 대규모 모델 구조
Kimi Delta Attention(KDA)과 Attention Residuals(AttnRes)는 긴 문맥과 깊은 네트워크에서 정보가 흐르는 방식을 개선하기 위한 구조입니다. Moonshot AI는 K2 대비 전체 스케일링 효율이 약 2.5배 개선됐다고 설명하지만, 이 수치는 개발사의 자체 측정입니다. 독립 평가와 실제 사용 비용을 함께 확인해야 합니다.
외부 평가는 어느 정도인가?
독립 모델 평가 사이트 Artificial Analysis는 7월 22일 확인 기준 Kimi K3에 Intelligence Index 57점을 부여해 186개 비교 모델 중 4위로 표시했습니다. 반면 평균 출력 속도는 약 36.1토큰/초로 상대적으로 느렸고, 평가 과정에서 출력 토큰도 많은 편으로 집계됐습니다.
벤치마크를 볼 때 주의할 점
- Moonshot AI의 자체 벤치마크와 외부 기관의 평가는 분리해서 봐야 합니다.
- 모델마다 추론 강도, 에이전트 도구, 실행 시간과 평가 환경이 다릅니다.
- 높은 점수가 모든 업무에서 더 빠르고 저렴하다는 뜻은 아닙니다.
- K3는 성능이 강한 대신 속도·출력량·비용을 함께 관리해야 하는 모델에 가깝습니다.
따라서 “GPT나 Claude를 완전히 이겼다”는 식의 단정은 정확하지 않습니다. Moonshot AI도 공식 글에서 전체 성능이 가장 강력한 독점 모델보다 여전히 뒤처지는 영역이 있다고 밝혔습니다. K3의 경쟁력은 오픈웨이트 공개 계획, 100만 토큰, 멀티모달, 장시간 에이전트 작업을 하나의 모델에 결합했다는 점에서 보는 편이 맞습니다.
Kimi K3 API 가격
2026년 7월 22일 공식 Kimi API 문서에 표시된 가격은 다음과 같습니다. 세금은 별도이며 실제 청구액은 지역과 사용량에 따라 달라질 수 있습니다.
| 구분 | 100만 토큰당 가격 |
|---|---|
| 입력·캐시 적중 | 0.30달러 |
| 입력·캐시 미적중 | 3.00달러 |
| 출력 | 15.00달러 |
출력 단가가 입력보다 높고 K3가 상세하게 답하는 경향이 있다는 외부 평가를 고려하면, API에서는 최대 출력 길이와 추론 강도, 캐시 활용 여부를 함께 관리하는 것이 중요합니다.
Kimi K3는 어디에서 사용할 수 있나?
- 일반 사용자: Kimi.com 또는 최신 모바일 앱
- 업무·리서치: Kimi Work의 문서, 시트, 슬라이드, 대시보드 기능
- 개발자: Kimi Code 또는 Kimi API Platform
- 자체 운영: 7월 27일로 예고된 모델 가중치 공개 후 라이선스와 하드웨어 요구사항 확인
현재 Kimi 웹과 API를 쓸 수 있다고 해서 오픈웨이트 파일도 이미 내려받을 수 있다는 뜻은 아닙니다. 자체 서버 운영을 계획한다면 가중치 공개 여부, 라이선스, 양자화 형식, vLLM 지원과 최소 하드웨어 조건을 다시 확인해야 합니다. 공식 문서는 대규모 배포에 64개 이상 가속기를 갖춘 슈퍼노드 구성을 권장하고 있어 개인 PC에서 2.8조 전체 모델을 그대로 운영하는 것은 현실적으로 어렵습니다.
누구에게 유용하고, 누구에게는 과할까?
| 추천 상황 | 다른 모델도 비교할 상황 |
|---|---|
| 대규모 코드베이스 분석 | 짧은 질의와 빠른 응답이 중요한 업무 |
| 여러 문서와 데이터를 묶은 리서치 | 출력 비용을 최우선으로 줄여야 하는 서비스 |
| 스크린샷과 코드를 함께 보는 작업 | 작은 로컬 GPU에서 직접 구동하려는 경우 |
| 장시간 도구 호출형 에이전트 | 검증 없이 결과를 즉시 확정해야 하는 업무 |
Kimi K3 관련 자주 묻는 질문
Kimi K3는 오픈소스인가요?
Moonshot AI는 전체 모델 가중치를 2026년 7월 27일까지 공개하겠다고 밝혔습니다. 글 작성 시점에는 공개 예정 상태이므로, 정확한 오픈웨이트 라이선스와 다운로드 방법은 공개 후 확인해야 합니다.
100만 토큰을 무료로 사용할 수 있나요?
100만 토큰은 모델이 지원하는 최대 문맥 길이입니다. 무료 사용량이나 구독 한도와는 다른 개념이며, API는 실제 입력·출력 토큰 사용량에 따라 과금됩니다.
Kimi K3가 GPT·Claude보다 더 좋은가요?
일부 코딩·에이전트·지식 업무 평가에서는 상위권이지만 모든 작업에서 우월하다고 볼 근거는 없습니다. 품질뿐 아니라 응답 속도, 출력량, 도구 호환성과 비용을 같은 조건에서 비교해야 합니다.
한국어도 사용할 수 있나요?
Kimi 웹에서 한국어로 질문할 수 있습니다. 다만 전문 번역, 법률·의료·재무처럼 정확성이 중요한 업무는 원문 출처와 결과를 별도로 검증해야 합니다.
한 줄 결론
Kimi K3의 핵심은 단순한 모델 크기가 아니라 100만 토큰, 멀티모달, 장시간 코딩과 지식 업무, 오픈웨이트 계획의 결합입니다. 지금은 웹과 API로 작은 실제 업무를 시험하고, 7월 27일 가중치·기술보고서·라이선스 공개 후 자체 운영 가능성을 다시 판단하는 순서가 합리적입니다.
공식 자료와 확인 출처
최종 확인: 2026년 7월 22일. 가격, 구독 가능 여부, 벤치마크 순위와 모델 공개 일정은 이후 변경될 수 있습니다. 본문 대표 이미지는 QuickInfo가 직접 제작했으며, 공식 벤치마크 이미지는 모바일 가독성과 조건 오해를 피하기 위해 재게시하지 않고 원문 링크로 제공했습니다.
참조 분석: 네이버 유사 글 3개 상세 분석 반영. 기존 글들이 반도체·주가 이슈에 치우친 점을 확인해, 공식 사양·가격·이용 방법·한계 중심으로 차별화했습니다.
