본 사이트는 파트너스 활동으로 수수료를 받으며, 서버 운영과 무료 앱 개발에 사용됩니다. 본 사이트는 파트너스 활동으로 수수료를 받으며
서버 운영과 무료 앱 개발에 사용됩니다.
목록으로
테크·IT

Kimi K3 2.8조 공개 모델 | 벤치·가격·커뮤니티 반응 정리

최초 발행: 2026년 7월 17일 오전 11:01 | 최종 수정: 2026년 7월 17일 오전 11:40

Moonshot AI가 2026년 7월 16일 Kimi K3를 공개했다. 파라미터 수 2.8조, 네이티브 비전, 100만 토큰 컨텍스트를 내세운 공개(오픈) 3T급 모델이다. 공식 블로그는 장시간 코딩·지식 작업·추론을 겨냥한다고 적었고, 같은 날 Kimi.com·Kimi Work·Kimi Code·Kimi API에서 바로 쓸 수 있게 열었다.

전체 체급은 아직 Claude Fable 5, GPT 5.6 Sol 아래라고 스스로 밝힌다. 다만 자체 평가표와 Artificial Analysis·Arena 등 외부 신호를 겹쳐 보면, Opus 4.8·GPT 5.5 구간을 넘고 최상위 바로 아래에서 자주 맞붙는 위치다. 가중치 파일은 2026년 7월 27일까지 공개한다고 예고했다. 그 전까지는 API·제품 경로로만 접근한다.

이 글은 공식 발표(Kimi K3 블로그), 하다 뉴스 요약, 아카라이브·NVIDIA 개발자 포럼 반응, Simon Willison·BenchLM 등 2차 보도를 교차해 정리한다. 벤치 숫자는 하네스·출처가 달라 직접 대결표로만 읽지 않는 편이 안전하다.

2026년 7월 16~17일 전후, 코딩·에이전트 커뮤니티에서는 Kimi K3를 제2의 딥시크 충격에 가깝게 이야기하는 분위기가 퍼졌다. Claude Code 쪽 Fable 5, ChatGPT Codex 쪽 GPT 5.6 Sol에 근접하거나 일부 축에서 앞선다는 소문·리더보드 신호가 겹쳤고, 미국 쪽 폐쇄형 접근 통제 논란과 맞물려 “막느라 육갑 떨다 따라잡혔다”는 반응까지 나왔다. 다만 공식·외부 평가를 같이 보면 종합 UX는 아직 Fable·Sol 아래이고, API 단가는 이전 Kimi보다 비싸 OpenCode Go 같은 구독에서도 사용량이 빨리 깎인다는 실무 불만도 동시에 올라온다.

체험이 필요하면 Kimi 가입·초대 혜택 링크로 들어가 앱·웹에 로그인하면 된다. 초대 경로에는 가입 후 제한 시간 안에 받아야 하는 멤버십 크레딧·추첨 조건이 붙을 수 있으니, 화면 안내를 그대로 확인하는 편이 안전하다. (제휴 링크)

Kimi K3 공식 히어로
그림 1. Moonshot AI 공식 블로그의 Kimi K3 히어로 비주얼
Kimi K3 한눈에
그림 2. Kimi K3 핵심 스펙 — 2.8조 파라미터, 100만 토큰, 네이티브 비전, 공개 3T급

1. 무엇이 새로웠나

1.1. 공개 스케일의 상한 갱신

  1. Kimi는 지난 12개월 중 9개월가량 공개 모델 크기 상한을 밀어 올렸다고 주장한다.
  2. K3는 DeepSeek V4 Pro(약 1.6T) 이후 처음으로 2.8T에 도달한 공개 라인업으로 소개된다.
  3. MoE 희소성은 896 전문가 중 16개를 활성화하는 Stable LatentMoE로 설명된다.

1.2. 아키텍처 키워드

  1. Kimi Delta Attention(KDA) — 긴 시퀀스에서 어텐션을 효율적으로 키우기 위한 기반.
  2. Attention Residuals(AttnRes) — 깊이를 균일 누적하지 않고 필요한 표현을 선택적으로 가져온다.
  3. 학습·데이터 레시피와 합쳐 K2 대비 스케일링 효율이 약 2.5배라고 한다.
  4. 추론 쪽에서는 MXFP4 가중치·MXFP8 활성, 64개 이상 가속기 supernode, vLLM용 KDA prefix cache 기여를 언급한다.
KDA AttnRes LatentMoE 구조
그림 3. KDA·AttnRes·Stable LatentMoE를 한 장으로 묶은 구조 요약
공식 아키텍처 도식
그림 4. 공식 블로그에 실린 Stable LatentMoE·KDA·AttnRes 블록 도식

2. 벤치마크 읽는 법

공식 표는 temperature 1.0·top-p 1.0·사고 노력 max를 기준으로 한다. 벤치마다 KimiCode·Claude Code·Codex 하네스가 갈리고, Fable 5는 제3자 평가·fallback 가능성이 각주로 붙어 있다. 그래서 “한 점수로 승패”보다 어느 축에서 앞서는가를 보는 편이 낫다.

벤치마크 포지션
그림 5. Fable 5·GPT 5.6 Sol 아래, Opus 4.8 위에서 자주 관측되는 위치
공식 코딩 벤치 차트
그림 6. 공식 코딩 벤치 — Program Bench·SWE Marathon에서 K3가 표 내 선두

공식 에이전트 벤치 차트 그림 7. 공식 에이전트·생산성 벤치 차트(BrowseComp 등)

2.1. 코딩 축에서 눈에 띄는 숫자

벤치Kimi K3 (max)Claude Fable 5GPT 5.6 SolClaude Opus 4.8GPT 5.5
DeepSWE67.570.073.059.067.0
Program Bench77.876.877.671.970.8
Terminal Bench 2.188.384.688.884.683.4
FrontierSWE81.286.671.366.764.9
SWE Marathon42.035.039.040.014.0
Kimi Code Bench 2.072.976.964.871.769.0

Program Bench·SWE Marathon처럼 장시간·에이전트형 코딩에서 표 안 1위를 찍고, DeepSWE·FrontierSWE·내부 KCB에서는 Fable/Sol에 밀리는 패턴이다.

2.2. 에이전트·지식·비전

벤치Kimi K3비고
BrowseComp91.2표 내 선두. 1M 컨텍스트·무관리 시 90.4
DeepSearchQA (f1)95.0표 내 선두
Automation Bench30.8표 내 선두
SpreadsheetBench 234.8표 내 선두
OmniDocBench91.1비전·문서 축 선두
GDPval-AA v2 (Elo)1668Fable 1760 · Sol 1748 아래
GPQA-Diamond93.5Sol 94.1과 근접
HLE-Full43.5Fable 53.3·도구 사용 63.0에 뒤짐
MMMU-Pro81.6Sol 83.0·Fable 81.2 사이

Artificial Analysis Intelligence Index(아카라이브에 공유된 차트)에서는 K3가 종합 3위(약 57)로, Fable 5·GPT 5.6 Sol 바로 뒤에 붙는다. Arena.ai Frontend Code Arena에서는 Fable·GPT 5.6·GLM을 제치고 1위 신호가 나왔다.

Artificial Analysis 종합 순위
그림 8. Artificial Analysis Intelligence Index에서 Kimi K3 종합 3위(아카라이브 공유본)
Frontend Arena 1위
그림 9. Arena.ai Frontend Code Arena 1위 캡처(아카라이브 공유본)

3. 장시간 코딩 사례가 말하는 것

공식 케이스는 “점수표”보다 몇 시간~수십 시간 동안 도구를 돌리는 능력을 보여 주려는 쪽에 가깝다.

3.1. GPU 커널·컴파일러

  1. AttnRes 커널에서 순·역전파 시간을 283.6ms → 114.4ms로 줄였다고 한다.
  2. 대체 벤더 GPGPU에서 KDA를 73.6% 단축했다고 적었다.
  3. MiniTriton이라는 Triton류 컴파일러를 처음부터 만들어 nanoGPT 학습까지 이어 갔다고 한다.

3.2. 게임·칩·과학

  1. Three.js WebGPU 기반 절차적 3D 오픈월드 데모를 공개했다. 영상 원본은 공식 mp4다.
  2. 48시간 자율 런으로 Nangate 45nm 기반 칩을 설계·검증했다고 한다(4mm²·100MHz·시뮬상 8,700+ tok/s).
  3. I–Love–Q 천체물리 파이프라인을 약 2시간에 재현했다고 비교한다.
게임 오픈월드 캡처
그림 10. 공식 케이스 — 브라우저 3D 오픈월드. 데모 영상: 위 mp4 링크
쇼케이스 A
그림 11. 공식 쇼케이스 비주얼 A

쇼케이스 B 그림 12. 공식 쇼케이스 비주얼 B

지식 작업 쪽에서는 ASIC 산업 42년 인터랙티브 리포트, 핵융합 산업 보고서, GWTC-5 중력파 분석, Widgets·Dashboard, 영상 편집(티저 56클립) 사례를 나열한다. 내부 Knowledge Work Bench 차트도 함께 공개됐다.

내부 Knowledge Work Bench 그림 13. 공식 내부 Knowledge Work Bench 결과

4. 가격·이용 경로

API 모델 ID는 kimi-k3다. 공개 단가는 캐시 적중 입력 $0.30/MTok, 캐시 미적중 입력 $3.00/MTok, 출력 $15.00/MTok이다. 코딩 워크로드에서 공식 API 캐시 적중률이 90%를 넘는다고 한다. Kimi Work는 3.1.0 이상, Kimi Code는 /model로 선택한다. 출시 기본 사고 노력은 max이며 low/high는 후속 업데이트 예정이다.

이전 K2.6 대비 단가가 크게 오른 점은 해외 해설·국내 커뮤니티에서 공통으로 지적된다. 아카라이브에서는 토큰 효율은 K2.6보다 좋아졌지만, 토큰당 단가 상승으로 작업당 비용이 GPT 5.6 Sol max와 비슷한 구간에 붙는다고 정리했다. Opus·Fable·Sonnet보다는 여전히 싸다는 비교도 함께 올라왔다.

이용 경로와 API 가격
그림 14. 이용 경로와 API 단가 요약(표의 단가는 API 기준)
토큰 효율
그림 15. K2.6 대비 토큰 사용량·효율 그래프(아카라이브 공유본)

작업 비용 비교 그림 16. 작업당 비용이 Sol max와 근접한다는 비교 차트(아카라이브 공유본)

5. 가격 분석

K3 단가는 “싼 중국 오픈 모델” 프레임과 어긋난다. 국제 API·OpenRouter는 사실상 동일 표, 중국 플랫폼은 위안화 표로 따로 있고, OpenCode Go는 구독 안에서도 K3만 사용량 풀이 얇다. 아래는 2026년 7월 17일 기준 공개 문서 수치다. 환율·프로모션·세금은 결제 화면이 최종이다.

5.1. 채널별 단가 한눈에

채널캐시 적중 입력캐시 미적중 입력출력비고
공식 국제 API (platform.kimi.ai)$0.30/MTok$3.00/MTok$15.00/MTok모델 ID kimi-k3 · 컨텍스트 1,048,576 · 구간별 가산 없음
OpenRouter (moonshotai/kimi-k3)$0.30/MTok$3.00/MTok$15.00/MTokMoonshot 직결. 실효 입력은 캐시율에 따라 평균 ~$0.46~$0.51/M 관측
중국 API (platform.kimi.com)¥2.00/MTok¥20.00/MTok¥100.00/MTok국제표와 비율이 대략 일치(약 6.7×). 충전 프로모(최고 30% 쿠폰) 별도
OpenCode Go 내부 과금$0.30$3.00$15.00구독 한도 안에서 같은 토큰단가로 차감

5.2. OpenCode Go — 출시·한도·왜 “빨리 닳나”

  1. 출시·포함 여부: OpenCode Go는 이미 판매 중이며(\$5 첫 달 → \$10/월), 모델 목록에 Kimi K3가 포함돼 있다. 설정 ID는 opencode-go/kimi-k3.
  2. 구독 공통 한도: 사용량 달러 기준 5시간 \$12 / 주 \$30 / 월 \$60.
  3. K3만 얇은 풀: 문서상 K3의 모델별 월간 사용량 배정은 \$15다. 같은 표에서 K2.7 Code·K2.6 등은 \$60이다. 단가도 \$3/\$15로 높으니, Go 안에서 K3를 메인으로 쓰면 한도가 먼저 바닥난다.
  4. 요청 한도(추정 표): K3는 5시간 140 · 주 340 · 월 680 요청으로, K2.7 Code(월 9,250)와 자릿수가 다르다.
  5. 그래서 “OpenCode Go에도 있다”와 “Go로 K3를 마음껏”은 다른 문장이다. 가벼운 코딩은 K2.7 Code·기타 저가 모델, 한 방 난이도만 K3로 보내는 식이 현실적이다.

5.3. 중국 내 소비자 가격(앱·멤버십) vs API

API 위안화 표와 별개로, Kimi 앱/회원은 Adagio(무료) · Andante ¥49 · Moderato ¥99 · Allegretto ¥199 · Allegro ¥699/월 체계다(도움센터 기준, 연결제 할인 있음). Agent·Kimi Code 등은 공유 额度 풀에서 깎인다. Kimi Code 문서상 K3 사용·1M 컨텍스트는 상위 멤버십 조건과 묶이는 경우가 있으니, 앱 체험 ≠ API 단가로 나눠 보는 편이 맞다. 앱 가입·초대는 제휴 링크로 들어갈 수 있다. (제휴 링크)

5.4. 체감 비용 감각

시나리오대략 감각
코딩 에이전트, 캐시 적중률 90%+입력은 사실상 $0.30대. 공식도 코딩 워크로드 캐시 90%+를 주장. OpenRouter 실효 입력도 ~$0.5 근처로 관측
캐시 거의 없음 + max thinking입력 \$3 + 출력 \$15. 추론 토큰이 길면 출력·reasoning이 비용을 지배
OpenCode Go에서 K3만\$15 배정 × 고단가 → “구독했는데 금방 막힘” 체감이 나기 쉬움
중국 API 위안화¥20/¥100은 국제 \$3/\$15와 같은 가격대. 충전 보너스(출시 프로모)로 실효 단가만 잠깐 내려감
K2.6과 비교K2.6 계열은 입력 ~\$0.6~\$0.95 · 출력 ~\$2.5~\$4 구간. K3는 수 배 비싸 “가성비 오픈”이 아니라 프론티어 가격

5.5. 선택 가이드

목적추천 경로
벤치·한 방 에이전트, 카드로 바로공식 국제 API 또는 OpenRouter (moonshotai/kimi-k3)
월 \$10으로 여러 중국 모델 섞어 쓰기OpenCode Go — 단 K3는 보조 무기
위안화 결제·중국 플랫폼platform.kimi.com API + 충전 프로모 확인
앱·Work·Code 제품 UX멤버십 티어 확인 후 체험 링크 (제휴 링크)
예산 민감 일상 코딩K2.7 Code / K2.6 또는 Go의 저가 모델 유지

한 줄: K3의 공개 표는 채널이 달라도 $3 / $15 (캐시 $0.30) 로 수렴하고, 중국은 이를 ¥20 / ¥100 (캐시 ¥2) 로 표기한다. 싸게 느껴지려면 캐시Go의 다른 모델이 필요하고, K3 자체를 싸게 쓰는 공식은 거의 없다.

6. 커뮤니티·인프라 반응

6.1. 하다 뉴스

하다 토픽 31502은 2.8T·KDA/AttnRes·장시간 코딩 사례·7월 27일 가중치·Fable/Sol 대비 UX 격차를 짧게 압축해 전달한다. 한국어권에서 공식 글을 먼저 훑을 때 쓰는 요약본에 가깝다.

6.2. 아카라이브(AI 언어모델 로컬)

글 177108184는 AA 종합 3위·개별 벤치·토큰/비용 그래프·Frontend Arena 1위를 묶어 올렸다. 댓글은 “코드아레나”, “2.8T 체급”, “로컬로 돌릴 엄두가 안 난다”로 갈린다. 성능 기대와 로컬 불가에 가까운 체급이 한 스레드에 동시에 보인다.

6.3. NVIDIA 개발자 포럼

GB10 클러스터 천장 토론에서는 K3를 Opus 위·Sol/Fable 근처로 본 뒤, GB10 기준 4bit로도 다수 노드 클러스터가 필요하다는 계산이 나온다. 활성 파라미터가 상대적으로 작아도 프로슈머 4노드 구성의 실용 상한은 Opus급에 가깝다는 의견, 반대로 중형 모델 증류·플래시 변형이 결국 중요하다는 반박이 오갔다. “오픈 3T”가 로컬 오픈과 동의어가 아니라는 현실을 잘 보여 주는 스레드다.

6.4. 해외 2차 보도·레딧 맥락

Reddit 원문은 WAF로 직접 수집이 막혀, 출시 전후 누수 스레드를 인용한 해설(Tosea 등)과 Simon Willison의 pelican 테스트로 보완했다. Willison은 max-only 사고·숨은 시스템 프롬프트 추정·비전 품질·가격 인상(중국 랩 기준 고가)을 짚었고, BenchLM은 AA Intelligence 57.11·Coding 76.24·Agentic 50.07, Frontend Arena 1위 등을 정리한다. VentureBeat·MarkTechPost는 “최대 공개 모델” 프레임으로 보도했다.

커뮤니티 반응 요약
그림 17. 하다·아카·NVIDIA 포럼·해외 반응을 네 칸으로 압축
NextBigFuture 점수 비주얼
그림 18. NextBigFuture 등에 퍼진 K3 점수 비주얼(2차 보도)

7. 소버린 AI와 미국 폐쇄 정책의 양날

7.1. 소버린 AI가 가리키는 것

  1. 소버린 AI(Sovereign AI) 는 한 국가·기관·기업이 모델·데이터·인프라를 외부 플랫폼에 통째로 맡기지 않고, 자체 통제권 안에서 돌리려는 움직임을 말한다.
  2. 공개 가중치(오픈 웨이트)는 “다운로드해서 로컬·자국 클라우드에 올리면 된다”는 경로를 열어, 접근 권한이 갑자기 끊겨도 버틸 여지를 만든다.
  3. DeepSeek·Qwen·Kimi처럼 중국 랩이 공개 가중치를 밀어 올리는 흐름은, 정책 논평에서 다운로드로 얻는 주권(sovereignty by download) 으로도 불린다.

7.2. 미국 폐쇄·접근 통제가 남긴 역설

  1. 미국은 칩 수출 통제와 함께, 프론티어 모델의 해외 접근을 조이는 방향으로 움직였다. 2026년 6월경 Anthropic Fable·Mythos 계열의 해외 접근이 흔들린 사례는, “미국 모델을 기본값으로 쓰던 팀”에게 의존성 리스크를 각인시켰다.
  2. 그 공백을 메우는 후보로 중국 공개 가중치·저가 API가 떠오른다. K3 출시 직후 “폐쇄로 막다가 발등에 불”이 떨어졌다는 식의 반응은 이런 맥락이다.
  3. 동시에 중국 쪽도 모델은 열고 데이터·규제·전략 자산은 잠그는 양손 전략이 관측된다. 엔진은 퍼뜨리고, 핵심 지도는 남긴다는 비판이 나온다.

7.3. 양날의 칼

이득으로 읽히는 면위험·비용으로 읽히는 면
갑작스러운 API 차단·정책 변경에 덜 묶임공개 가중치라도 라이선스·검열·공급망 신뢰 문제는 남음
자국·사내 인프라에 올려 컴플라이언스 설계 가능2.8T급은 로컬 주권이 곧 GPU 클러스터·전기요금 주권
벤치·가격으로 미국 폐쇄형에 압박보안·IP·증류 논쟁, 지정학 리스크가 제품 선택에 섞임
개발자 생태계가 표준을 빠르게 흡수“오픈” 마케팅과 가중치 미공개 구간(K3는 7/27 예고)이 어긋날 수 있음

요약하면, 소버린 AI는 “미국 것만 쓰면 안전하다”는 가정과 “중국 오픈이면 공짜 주권”이라는 가정 둘 다 깨뜨린다. K3는 그 논쟁의 최신 사례일 뿐, 만능 해답이 아니다.

8. Cursor·Composer와 Kimi, 그리고 머스크

8.1. 커서가 쓴 그 베이스

  1. Cursor의 자체 코딩 모델 Composer 계열은 Moonshot Kimi K2.5 공개 체크포인트를 베이스로 쓰고, Cursor가 장시간 코딩 RL·후학습을 얹었다는 점이 공개 논쟁 끝에 확인됐다.
  2. Composer 2.5도 같은 K2.5 계열 베이스로 설명되는 경우가 많다. 즉 K3는 “커서와 무관한 중국 모델”이 아니라, 이미 개발자 도구 스택에 스며든 라인의 다음 체급으로 읽힌다.
  3. 커뮤니티에서 K3를 “커서 포크의 원류가 더 커졌다”고 부르는 이유다. 다만 Composer는 Cursor 후학습본이고, K3는 Moonshot 플래그십이다. 동일 모델이 아니다.

8.2. SpaceX·머스크 쪽 행보

  1. 2026년 상반기 SpaceX(머스크 진영)와 Cursor/Anysphere 사이에 대규모 지분·인수 옵션·Colossus 연산 협력 보도가 이어졌다. 보도에 따라 금액·일정은 다르니, 확정 사실과 옵션을 구분해 보는 편이 맞다.
  2. 머스크는 한때 Cursor를 “다른 모델 껍데기”로 비판했다가, 연산 협력 이후 Composer를 공개적으로 응원하는 쪽으로 톤이 바뀌었다는 해설이 있다.
  3. K3가 뜨는 지금, Cursor가 다음 모델을 Kimi 베이스로 갈지·Colossus에서 처음부터 키울지가 다음 관전 포인트다. K3 공개 가중치(7/27)가 나오면 포크·후학습 경쟁이 한 번 더 불붙을 수 있다.

8.3. 반도체·시장 반응을 “원인”으로 단정하지 말 것

K3·공개 3T급 담론이 반도체·AI 인프라 주가 변동 서술의 한 조각으로 등장하는 경우는 있다. 다만 주가에는 금리·실적·수출 통제·수요 사이클이 동시에 작용한다. K3 하나가 하락의 원인이라고 단정하지 않는 것이 맞다.

9. 출시 직후 반응 — 충격과 비싼 맛

9.1. “Fable·Sol 경쟁자” 프레임

  1. YouTube 등에서는 Kimi K3 Is INSANE – Is THIS a Sol & Fable Competitor?처럼 Sol·Fable 경쟁자 제목으로 다룬다.
  2. X(트위터) 공식 계정은 Meet Kimi K3 영상을 올렸고, 제작에 Kimi가 쓰였다고 소개하는 흐름이다.
  3. 하다 뉴스(토픽 31502)는 2.8T·장시간 코딩·7/27 가중치를 압축해 한국어권에 전파했다.

9.2. 비싸다는 실무 감각

  1. API 단가(캐시 미적중 $3 / 출력 $15)는 이전 Kimi 대비 크게 올랐고, GPT 5.6 Sol max 작업 비용과 비슷한 구간이라는 비교가 나온다.
  2. OpenCode Go 등 구독·크레딧형 환경에서는 사용량(쿼터)이 빨리 소진된다는 체감 후기가 있다. “벤치는 센데 지갑·쿼터가 먼저 닳는다”는 양면이다.
  3. 캐시 적중($0.30)을 노리는 코딩 워크플로가 아니면, 체감 단가는 마케팅 카피보다 높다.

체험이 필요하면 Kimi 가입·초대 혜택 링크로 들어가 앱·웹에 로그인하면 된다. 초대 경로에는 가입 후 제한 시간 안에 받아야 하는 멤버십 크레딧·추첨 조건이 붙을 수 있으니, 화면 안내를 그대로 확인하는 편이 안전하다. (제휴 링크)

10. 레딧 반응 정리 (2026-07-17)

K3는 7월 16일 웹·앱에 풀렸고, 7월 17일까지 r/LocalLLaMA · r/singularity · r/OpenAI · r/ClaudeCode · r/kimi에서 스레드가 연쇄로 올랐다. 상위 글 upvote 비율이 0.96~0.98대인 경우가 많아 전체 톤은 흥분·호의 쪽이지만, 같은 스레드 안에 벤치 체리피킹 경계 · 실사용 엇갈림 · 자체호스팅 좌절 · 미중 규제 밈이 동시에 돌아간다. 아래는 그날 수집된 주요 스레드·원문 코멘트를 서브레딧별로 압축한 것이다. 점수는 수집 시점 스냅샷이다.

10.1. 하루 키워드

  1. Frontend / WebDev Code Arena 1위가 가장 먼저 퍼졌고, “Overall·Coding·Math까지 압살”로 읽는 사람과 “WebDev 한정”으로 읽는 사람이 갈렸다.
  2. 토큰 효율은 칭찬이 많다. API 표($3/$15)는 Sol과 비슷해도, 태스크당 토큰이 적으면 실효 비용이 내려간다는 주장.
  3. 7월 27일 전체 가중치 예고를 두고 “오픈 확정” vs “아직은 proprietary+약속” 논쟁이 붙었다.
  4. 2.8T 앞에서 로컬 불가 밈과 “$100k면 된다 / 절대 안 된다” 자체호스팅 경제성 토론이 길었다.
  5. Claude·OpenAI 사용자층에서는 이탈 유혹중국 프라이버시 거부가 한 스레드에 공존했다.

10.2. r/singularity · r/kimi — Arena 1위와 쇼케이스

대표 스레드: Kimi K3 tops Frontend Code Arena (약 796점대), 출시 루머 스레드 launching soon (약 365점), r/kimi — actually very impressive.

원문 분위기:

  • runaway-devil: Fable의 1/3 가격에 오픈웨이트라면 잘한 일이고, 정치 간섭보다 이런 게 필요하다고 했다.
  • FateOfMuffins: 가격표만 보지 말고 실비용을 보라. Opus 4.8 대비 토큰을 절반만 쓰면 실질 1/3, Fable 대비는 더 싸질 수 있다고 잡았다.
  • SureMedia2685 (r/kimi): Fable 5로 만든 결과물 프롬프트를 K3에 그대로 넣었더니 포기하지 않고 약 4시간 돌려 애니메이션 바디를 냈다고 했다. “7종 중 하나”라는 쇼케이스 톤.
  • Correct_Mistake2640 / Zachattackrandom / Addition-Heavy (출시 전 루머 스레드): Claude Max 구독이 어려워질 수 있으니 GLM 5.2만 맞춰도 된다, 그보다 나쁘면 DOA, 싸고·빠르고·비전이면 자리 하나는 남는다는 기대치 조율.
  • Technical-Earth-3254: K2.7 Code가 지금까지 최애 오픈 코더였다고 K3에 기대를 얹었다.

회의 쪽:

  • AmbitiousInjury783 등: “이건 Code Arena다. 현실 측정이 아니다.”
  • Dany0 (LocalLLaMA 쪽과 공유되는 논지): three.js 3D 게임으로 LLM을 평가하는 문화를 팀이 알고 특화 훈련했을 수 있다는 음모론. nullmove·buppermint는 AA 57점과 유저 제공 프롬프트 구조를 들어 반박했다.

10.3. r/OpenAI — “중국 랩이 한참 뒤처진 시대는 끝?”

스레드: KimiK3 arrived — the era of Chinese labs being far behind… (약 908점, upvote ~92%).

Gemini 조롱 축:

  • WorkingAd1564: Gemini 3.5 Pro가 또 한 달 연기될 것이라는 농담.
  • ozone6587 / Tupcek: 2030년·엘더스크롤 6와 박빙이라는 식의 밈.
  • LoudUnderstanding331: Gemini는 최고점보다 일상 채택을 노린다는 반론.
  • scamiran: 정원·요리엔 괜찮은데 공학·화학은 약하고, Sol이 압살하며 Kimi가 특히 낫다는 실사용 평.

규제·Mythos/Fable 축:

  • bubu19999: Mythos를 숨기는 게 누구에게도 해결책이 아니라고 했다.
  • Deto: 연방정부가 Anthropic에 강한 제약을 거는 사이 OpenAI와 이런 모델은 덜한 보호장치로 나갈 수 있다고 읽었다.
  • KeyReading9664: Fable 5가 CVE 코드 리뷰조차 거부하는 식의 과보호가 수출 통제 명분이 돼선 안 됐다고 비판했다.

AA·순위 축:

  • xak47d: AA가 더 현실적이고 K3가 Opus 4.8·GPT-5.5보다 높다고 봤다.
  • TheFamousHesham: 중국이 한 달 정도 뒤처진 셈이라며 “몇 년” 담론을 비웃었다.
  • Big-Accident1958: 5.6 max엔 지지만 5.6 xHigh는 이기고, 속도는 5.6 high 느낌이라는 세분 비교.
  • SporksInjected: AA 기준으론 태스크당 더 비싸고 Sol보다 덜 유능·느리다는 반론. “프론트엔드 한정·다른 벤치 3위” 지적도 반복됐다.

10.4. r/LocalLLaMA — 출시 확인, Arena, 오픈웨이트, 호스팅 전쟁

출시 스레드: released on web and app (약 574점대). Arena 스레드: beats Claude Fable and GPT 5.6 Sol in… (약 794점, ~95%). 트렌드 스레드: open-weight models are about to… (약 200점, ~78% — 더 논쟁적). 사전 루머: in the next few hours….

“며칠 뒤처짐” 밈:

  • atape_1: 중국이 서방에 6일 뒤처진 것이냐.
  • Comacdo: 6일 뒤처졌는데 오픈웨이트라면 눈여겨본다고 했다.
  • featherless_fiend: DeepSWE 기준으로는 5.5(4월)와 동급이라 3개월 뒤처짐이 더 인상적이라고 재해석했다.
  • rageling → atape_1: “codex 대체품 왜 안 만드냐” / “나온 지 2시간인데 한 시간만 더 달라”는 자조 교환.

오픈웨이트 확정 여부:

  • Swimming_Beginning24: 공식 블로그의 “전체 웨이트 2026-07-27까지” 문구를 인용.
  • wotoan: Dario와 Altman이 지금 트럼프에게 전화 중일 것이라는 농담.
  • justgetoffmylawn: TikTok 때처럼 ‘자유시장’이 ‘국가안보’로 바뀌는 패턴을 경고했다.
  • ForsookComparison: 리더보드엔 아직 proprietary로 보이며, 오늘은 월말 오픈 약속이 붙은 독점 모델일 뿐이라고 정리했다.

자체 호스팅 경제성 (긴 가지):

  • TheWolfOfWalmart: ~$100k면 4분기에 돌릴 수 있어 미국 API사에 비관적이라고 했다.
  • squarabh: 4bit로도 로드에 ~1.4TB급 VRAM이 필요하고 KV까지 합치면 $100k로는 불가능, MI300X 2노드면 $500~600k·연속 ~20kW라고 반박했다.
  • nick4fake (데이터센터 쪽): 규모의 경제 때문에 API가 자체 하드웨어보다 싸다고 했다. DGX H200 한 대가 Kimi 스레드 하나 수준이라는 식.
  • jovialfaction: 8xB300 $50~60만·월 렌트 $8만 이하 가능, 자사는 월 수백만 달러 토큰비를 GLM 5.2·곧 Kimi로 대체 추진 중이라고 했다.

딥시크 모먼트 / 해자:

  • Professional-Try-273: 딥시크 모먼트가 또 왔다고 했다.
  • TimeCat5212: 일회성이 아니라 누구에게도 해자가 없다는 증명이라고 읽었다.
  • zxyzyxz: 구글이 2023년에 이미 ‘해자 없음’을 예견했다고 끌어왔다.

자정·회의 (open-weight 추월 스레드):

  • ForsookComparison (최상단급): 오픈웨이트 지지자지만, 그래프만 보고 ‘내일 Anthropic 폭망’을 외치는 LinkedIn/X화를 거부한다고 했다.
  • LocoMod: 1st파티에서 몇 시간 나온 모델로 벌써 Fable급 결론을 내리면 안 된다고 했다.
  • TheOwlHypothesis / Fuehnix: 실사용은 다르며, 글 자체가 AI 티가 난다고 비판했다.
  • ttkciar: 중국 5개년 계획이 오픈 LLM 기여를 요구한다는 인센티브 분석을 올렸고, 미국 편향 반박(RhubarbSimilar1683 등)과 지정학으로 번졌다.

로컬 밈 (반복):

  • RTX 6000 Pro 96GB 소유자도 “노숙자 된 기분”, “RAM만 2.672T 더”, “2070년 폰” 같은 자조가 인기.
  • 동시에 distill·quant로 트리클다운된다는 낙관이 우세했다.

10.5. r/ClaudeCode — 이탈 유혹과 방어

스레드: Well that's it then — Kimi K3 now beats all US… (약 109점, ~84%).

  • 일부: 7월 19일 이후 Fable 접근이 안 늘면 $200 Max 유저는 웹개발에서 하위권만 남는다는 이탈 언급.
  • AmbitiousInjury783 / _raydeStar: Code Arena·인간 평가는 조작·한계가 있으니 표준 벤치를 기다리라고 했다.
  • Jeidoz: AA에서 경제적(태스크당 토큰)인 점이 놀랍다고 했다.
  • hitmante: 5.6 Sol만큼 비싸 DOA에 가깝고, Codex는 월요금 대비 토큰·생태계가 낫다고 반박.
  • Time-Category4939: 그래도 OpenAI보다 오픈소스 쪽을 택하는 사람이 많아 DOA와는 거리가 멀다고 했다.
  • themajordutch: 중국 정부가 반쯤 완성된 프로젝트를 보는 게 꺼림칙하다고 했고, Ollama Cloud가 미국 서버라는 답에도 “그게 더 나쁠지도”로 이어졌다.
  • thomasthai: 프론트는 최고, 백엔드·에이전틱·수학·물리는 GPT가 최고라는 역할 분담 평.

10.6. 실사용 후기 — 같은 날의 양면

긍정:

  • ML 리서치 맥락에서 ‘vibes’로 때우지 않고 파이썬으로 검증했다는 인상 평이 공유됐다.
  • r/kimi 4시간 집요함 쇼케이스(위).

부정:

  • 단순 공유 의도 프롬프트에 20~30분 불안 루프로 헛돌았고, Mistral도 이해한 걸 못 했다는 비판.
  • thinking이 문법 깨진 문장으로 이상하다, 실제 프로젝트에선 굼떴다는 반응.

10.7. 레딧이 합의한 것 / 합의하지 않은 것

대체로 합의에 가까운 쪽여전히 싸움인 쪽
Frontend/WebDev Arena에서 K3 존재감이 크다Overall·백엔드·수학·에이전틱까지 “미국 압살”인가
토큰 효율·집요한 장시간 작업 일화는 인상적API $3/$15가 Sol과 비슷해 가격 해자가 있는가
7/27 웨이트 예고는 공식 문구로 존재오늘 시점에서 이미 open-weight인가
2.8T 풀로컬은 프로슈머 현실이 아니다$50만~ 클러스터·월 토큰비 대체 경제성
미중·규제·safety theater 밈이 폭발했다중국 오픈 제한 로이터 루머의 해석(왜곡 vs 실체)

읽는 법: 7월 17일 레딧은 K3를 “제2의 딥시크 충격” 후보로 올려놓되, Arena 1장·출시 수시간 후기로 최종 순위를 확정하지는 않았다. 공식 표·AA·7/27 가중치·독립 재현이 붙기 전엔, 위 원문은 커뮤니티 온도계로 쓰는 편이 맞다.

11. 제한과 실무 주의

공식 Limitations는 두 축이다.

  1. 사고 기록 민감성 — thinking history를 보존하는 방식으로 학습됐다. 하네스가 과거 thinking을 다 넘기지 않거나, 다른 모델 세션 도중 K3로 갈아타면 품질이 크게 흔들릴 수 있다. Kimi Code처럼 검증된 하네스·세션 분리 권장.
  2. 과도한 선제 행동 — 모호한 지점에서 사용자 대신 결정을 내릴 수 있다. 경계를 좁혀야 하면 시스템 프롬프트나 AGENTS.md에 제약을 명시한다.

Moonshot 스스로도 UX는 Fable 5·GPT 5.6 Sol과 뚜렷한 격차가 있다고 적었다. 벤치에서 이기는 축과, 제품에서 느끼는 안정감은 따로 봐야 한다.

12. 상황별 선택

상황선택 힌트
프론트·에이전트형 코딩을 API로K3를 후보 상단에. Frontend Arena·BrowseComp 신호가 강함
최고 난이도 HLE·최상위 UXFable 5 / GPT 5.6 Sol이 아직 우위
비용 민감·가벼운 작업K2.6·다른 오픈 가중치 모델 유지 검토. K3는 단가가 Sol급에 가까움
로컬·GB10 소수 노드2.8T 풀 가중치는 비현실적. 7/27 이후에도 양자화·증류·플래시 변형을 기다려야 함
오픈 가중치가 필수7월 27일 공개 전에는 아직 API·앱만. HF에 파일이 올라오기 전 “오픈”을 확정으로 쓰지 말 것

13. 마무리

앞에서 다룬 Kimi K3의 핵심만 짧게 정리한다.

  • 2.8T·1M 컨텍스트·네이티브 비전의 공개 3T급 발표(가중치 7/27 예고)
  • 공식 표에서 Program Bench·SWE Marathon·BrowseComp 등 장시간·에이전트 축이 강함
  • AA 종합 3위·Frontend Arena 1위 등 외부 신호가 출시 직후 붙음
  • API 단가는 캐시 적중 $0.30 / 미적중 $3 / 출력 $15 — 비용은 Sol max에 근접할 수 있음
  • GB10·로컬 커뮤니티는 성능과 인프라 천장을 동시에 이야기함
  • thinking history·과도한 선제 행동·UX 격차는 공식 한계로 명시됨
  • 벤치 하네스가 달라 단일 승패표로 단정하지 말 것
  • 소버린 AI는 주권이면서 인프라·신뢰·지정학 비용을 같이 떠안는 양날
  • Cursor Composer는 Kimi 베이스 후학습본이고, K3는 그 라인의 다음 체급 후보
  • 체험은 제휴 링크로 가능하나, 단가·쿼터를 먼저 계산할 것
  • 국제 API·OpenRouter는 $3/$15(캐시 $0.30), 중국 API는 ¥20/¥100(캐시 ¥2)로 수렴
  • OpenCode Go에 K3는 포함되나 월 사용량 배정 $15라 빨리 닳음
  • 7월 17일 레딧은 Arena·지정학·호스팅 밈이 뜨겁지만 출시 수시간 후기로 최종 순위를 확정하지 말 것

「K3는 폐쇄형 의존의 구멍을 건드리는 공개 3T급이지만, 소버린·커서·머스크 서사는 벤치 점수보다 지정학·단가·쿼터로 읽어야 한다.」 — 7월 27일 가중치와 독립 재평가가 나오면 이 글의 순위 해석도 함께 고쳐 읽으면 된다. 수치는 공식·AA·Arena 원문을 기준으로 재확인하는 것이 안전하다.

자주 묻는 질문

  • Kimi K3는 언제 나왔고 파라미터는 얼마인가?

    Moonshot AI가 2026년 7월 16일 공개했다. 공식 스펙은 2.8조 파라미터, 네이티브 비전, 100만 토큰 컨텍스트다. 제품·API는 당일부터, 전체 가중치는 2026년 7월 27일까지 공개한다고 예고했다.

  • Claude Fable 5·GPT 5.6 Sol보다 강한가?

    Moonshot 스스로 종합 성능과 UX는 Fable 5·GPT 5.6 Sol에 미치지 못한다고 적었다. 다만 Program Bench·SWE Marathon·BrowseComp 등에서는 표 안 선두를 찍고, AA 종합 3위·Frontend Arena 1위 신호도 있다. 축마다 승패가 갈린다.

  • API 가격은 얼마인가?

    공식 API(kimi-k3) 기준 캐시 적중 입력 $0.30/MTok, 캐시 미적중 입력 $3.00/MTok, 출력 $15.00/MTok이다. 코딩 워크로드에서 캐시 적중률 90% 이상을 주장한다. Kimi.com·Work·Code 구독 요금과 API 단가는 별개로 확인해야 한다.

  • 지금 로컬에서 돌릴 수 있나?

    출시 직후 시점에는 가중치가 아직 공개되지 않았다. NVIDIA 포럼에서는 GB10 기준 4bit라도 다수 노드가 필요하다는 계산이 나왔고, 아카라이브에서도 로컬 구동이 비현실적이라는 반응이 많다. 7월 27일 이후에도 양자화·증류 형태를 따로 봐야 한다.

  • 사고 노력(max)만 쓸 수 있나?

    출시 버전은 max thinking이 기본이며, low·high 모드는 후속 업데이트 예정이다. Simon Willison의 테스트에서도 단순 SVG 생성에 많은 reasoning 토큰이 쓰여 비용이 커질 수 있다고 지적됐다.

  • 세션 중간에 다른 모델에서 K3로 바꿔도 되나?

    공식 Limitations는 thinking history 전달이 깨지거나 세션 도중 모델 전환 시 품질이 불안정해질 수 있다고 경고한다. Kimi Code처럼 호환 하네스를 쓰고, 가능하면 새 세션에서 K3만 쓰는 편이 안전하다.

  • 하다·아카·NVIDIA 포럼은 무엇을 이야기했나?

    하다는 공식 요약을, 아카는 AA 3위·Frontend Arena 1위·비용 그래프를, NVIDIA 포럼은 GB10 클러스터 천장과 로컬 한계를 논의했다. 성능 기대와 인프라 현실이 같은 시기 반응의 양 축이다.

  • 공식 데모 영상은 어디서 보나?

    게임 오픈월드 데모 mp4는 Moonshot statics CDN에 있다. 본문 링크(statics.moonshot.cn/.../01-open-world.mp4)와 공식 블로그 게임 케이스 섹션에서 확인할 수 있다.

  • Kimi를 바로 체험하려면?

    앱·웹 가입 후 초대 혜택을 받으려면 제휴 경로 https://min-inter.co.kr/link/ai-coding-kimi 로 들어가면 된다. 가입 후 제한 시간 안에 로그인해야 크레딧·추첨이 열리는 조건이 붙을 수 있으니 화면 안내를 확인한다.

  • 소버린 AI란 무엇이고 왜 양날인가?

    소버린 AI는 모델·데이터·인프라를 외부에 통째로 맡기지 않고 통제권 안에서 돌리려는 움직임이다. 공개 가중치는 갑작스러운 API 차단에 버티는 수단이 되지만, 대형 모델은 GPU·전력·보안·지정학 비용을 함께 떠안는다. 중국 오픈 전략도 모델은 열고 데이터·규제는 잠그는 양손 비판이 있다.

  • Cursor Composer와 Kimi K3는 같은 모델인가?

    아니다. Cursor Composer 2·2.5는 Moonshot Kimi K2.5 공개 체크포인트를 베이스로 Cursor가 후학습·RL을 얹은 코딩 모델이다. K3는 Moonshot의 다음 플래그십(2.8T)이다. 계보로 연결되지만 동일 가중치·동일 API가 아니다.

  • 머스크·SpaceX와 Cursor는 어떤 관계로 보나?

    2026년 상반기 SpaceX 진영과 Cursor 사이 연산 협력·대규모 인수 옵션 보도가 이어졌다. 금액·일정은 보도마다 다르므로 확정으로 단정하지 않는 편이 맞다. K3 공개 이후 Cursor가 Kimi 베이스를 이어갈지, Colossus에서 새 모델을 키울지가 관전 포인트다.

  • K3가 비싸다는 말은 무슨 뜻인가?

    공식 API는 캐시 미적중 입력 $3/MTok·출력 $15/MTok로, 이전 Kimi보다 비싸고 Sol max 작업 비용과 비슷한 구간이라는 비교가 나온다. OpenCode Go 같은 구독에서는 쿼터가 빨리 닳는다는 체감 후기가 있다. 캐시 적중을 못 쓰면 체감 단가가 더 오른다.

  • OpenRouter에서 Kimi K3 가격은?

    OpenRouter 모델 moonshotai/kimi-k3 기준 캐시 적중 입력 $0.30/MTok, 캐시 미적중 입력 $3.00/MTok, 출력 $15.00/MTok다. 공식 국제 API와 동일하고, 캐시 적중률이 높으면 실효 입력 단가는 $0.5 근처로 내려가는 관측이 있다.

  • OpenCode Go에 Kimi K3가 나왔나? 왜 빨리 닳나?

    나왔다. OpenCode Go($5 첫 달 후 $10/월) 모델 목록에 Kimi K3가 포함되며 opencode-go/kimi-k3로 쓴다. 토큰 단가는 $3/$15이고, 문서상 K3 월간 사용량 배정은 $15로 K2.7 Code($60)보다 훨씬 얇아 한도가 먼저 소진되기 쉽다.

  • 중국 내 API·회원 가격은?

    중국 API(platform.kimi.com)는 캐시 적중 ¥2/MTok, 입력 ¥20/MTok, 출력 ¥100/MTok다. 앱 멤버십은 Andante ¥49부터 Allegro ¥699까지이며 Agent·Code 공유 额度와 별개로 API 종량제를 이해해야 한다. 충전 프로모(최고 30% 쿠폰 등)는 기간 한정이다.

  • 7월 17일 레딧은 Kimi K3를 어떻게 봤나?

    r/LocalLLaMA·r/singularity·r/OpenAI·r/ClaudeCode·r/kimi에서 전반적으로 흥분·호의(upvote 비율 높음)였다. Frontend Code Arena 1위와 토큰 효율이 화제였고, 동시에 WebDev 한정·벤치맥싱 의심·$3/$15 가격 반론·2.8T 로컬 불가 밈·미중 규제 농담이 같은 날 공존했다.

  • 레딧에서 가장 많이 싸운 쟁점은?

    Arena 1위를 전체 압살로 읽을지, 7/27 웨이트를 이미 오픈으로 부를지, 자체호스팅이 $100k로 가능한지, Claude Max 유저가 이탈할지와 중국 프라이버시 거부다. ForsookComparison 등 자정 코멘트가 그래프만 보고 Anthropic 폭망을 외치지 말라고 제동을 걸었다.