WEBBOOK CHAPTER

Kimi·Qwen·GLM 중국 AI 에이전트 실전: 1장 중국 AI 에이전트 쇼크를 과장 없이 읽는다

1장 중국 AI 에이전트 쇼크를 과장 없이 읽는다

2026년 7월 16일 Moonshot AI는 Kimi K3를 공개했다. “GPT-5.6과 Fable을 이겼다”는 문장은 일부는 맞고 전체로는 틀리다. 공개 당일 Arena 발표를 인용한 보도에 따르면 K3는 Frontend Code Arena에서 1,679점을 기록해 GPT-5.6 Sol과 Claude Fable 5보다 높았다. 이 평가는 정답률 시험이 아니라 블라인드 결과에 대한 사람의 선호를 Elo 방식으로 집계한 라이브 순위다. 표본과 순위는 계속 변한다. Moonshot의 기술 블로그도 종합 성능은 두 폐쇄형 모델보다 뒤진다고 적었다. Artificial Analysis의 2026년 7월 19일 화면에서 K3의 지능 지수는 57점이었다. 결론은 세계 1등 선언이 아니라 “작업별 강점이 달라 라우팅과 재검증이 중요해졌다”이다.

모델, 에이전트, 하니스, 제품도 구별해야 한다. Kimi K3는 기반 모델이다. Kimi Agent는 계획과 도구를 묶은 제품, Kimi Code는 저장소·셸·테스트를 다루는 코딩 하니스다. 같은 모델도 하니스가 파일을 어떻게 읽고, 권한을 언제 묻고, 오류를 어떻게 회복하는지에 따라 결과가 달라진다.

“오픈”이라는 단어도 기준일을 붙인다. Moonshot은 K3를 open 3T-class 모델로 소개했지만 전체 가중치는 2026년 7월 27일까지 공개하겠다고 예고했다. 7월 19일 Artificial Analysis 페이지는 가중치 미공개 상태를 반영해 proprietary로 분류했다. 따라서 이 초판은 K3를 공개 가중치를 예고한 모델이라고 쓴다. 실제 파일, 라이선스, 상업 이용 조건을 확인하기 전에는 “누구나 자유롭게 자체 호스팅할 수 있다”고 확대하지 않는다.

실습: 한 문장을 세 층으로 분해하기

claims/kimi-k3-verdict.md를 만들고 다음 표를 채운다.

기록할 것 K3 예시
사실 출처가 직접 말한 수치 Frontend Code Arena 1,679
추론 사실로부터 제한적으로 내린 결론 프런트엔드 후보 생성에 강할 수 있음
홍보 범위를 넓힌 표현 모든 개발에서 GPT를 능가

모든 기록에 observedAt, 원문 URL, 평가 조건을 붙인다. “능가”에는 반드시 “어떤 평가에서”를 붙인다. 가중치 공개 예정처럼 미래형 발표는 완료 사실로 쓰지 않는다.

체크포인트

  • 회사 발표와 독립 평가를 한 열에 섞지 않았는가?
  • 순위의 날짜와 과업을 적었는가?
  • 모델과 실제 제품을 구별했는가?

근거: Kimi K3 공식 블로그, Kimi Agent 개요, Artificial Analysis K3, Arena 발표를 인용한 2026-07-17 보도, 신화통신 공개 보도.