AI 모델
Kimi K2 Thinking
키미 K2 Thinking
1.06T 규모와 256K 문맥을 제공하는 Moonshot AI의 텍스트·코드·추론 오픈웨이트 모델
HuggingFace 모델 저장소의 다운로드 스냅샷을 정렬 신호로 사용합니다. 고유 사용자 수나 품질 점수는 아닙니다.

- 파라미터
- 1.06T 32B 활성
- 문맥 길이
- 256K
- 구조·입력
- MoE Transformer · 텍스트·코드·추론
- 제작 국가
- 중국
- MonoGPT 지원
- 현재 미지원
- 출시일
- 2025.11.04
01
핵심 요약
Kimi K2 Thinking은 MoE Transformer 구조의 1.06T 모델입니다. Modified MIT 조건으로 공개된 가중치와 모델 카드를 기준으로, 256K 문맥·텍스트·코드·추론 입력·실제 GPU 비용을 함께 검토해야 합니다.
Kimi K2 Thinking은 MoE Transformer 구조의 1.06T 모델입니다. Modified MIT 조건으로 공개된 가중치와 모델 카드를 기준으로, 256K 문맥·텍스트·코드·추론 입력·실제 GPU 비용을 함께 검토해야 합니다.
Kimi K2 Thinking의 원본 가중치와 모델 카드는 HuggingFace의 moonshotai/Kimi-K2-Thinking에서 확인할 수 있습니다. 동일한 이름의 API 서비스나 양자화 파생본은 사양과 이용 조건이 다를 수 있습니다.
02
주요 기능
벤치마크 순위보다 모델 구조, 입력 형식, 문맥과 실제 실행 환경을 함께 확인하세요.
MoE Transformer
MoE Transformer 구조와 32B 활성 파라미터 조건을 기준으로 처리량과 메모리를 설계해야 합니다.
256K 문맥
표시된 최대 문맥은 설정상 상한이며, 긴 입력에서의 정확도와 KV cache 메모리는 별도로 측정해야 합니다.
텍스트·코드·추론
텍스트·코드·추론 입력을 지원합니다. 전처리 방식, 채팅 템플릿과 추론 런타임 호환성을 모델 카드에서 확인하세요.
03
다운로드와 실행 비용
오픈웨이트 모델은 다운로드 가격보다 가중치 저장 공간, GPU 메모리, 처리량과 운영 인력이 실제 비용을 결정합니다.
| 플랜 | 가격 | 조건과 설명 |
|---|---|---|
| 공식 가중치 | 다운로드 무료 | HuggingFace의 moonshotai/Kimi-K2-Thinking 저장소에서 모델 파일과 카드를 확인할 수 있습니다. Modified MIT · 저장·전송·운영비 별도 |
| BF16 이론값 | 2116GB · 1971GiB | 1058.1B 파라미터에 파라미터당 2바이트를 적용한 단순 가중치 계산입니다. KV cache·활성값·런타임 오버헤드 제외 |
| 8-bit 이론값 | 1058GB · 985GiB | 양자화 형식과 추론 엔진에 따라 실제 용량, 속도와 품질이 달라집니다. 운영 여유 메모리 별도 |
| 4-bit 이론값 | 529GB · 493GiB | 파생 양자화 파일의 제작자, 방식, 호환성과 품질을 별도로 확인해야 합니다. 전체 GPU 요구량으로 해석하면 안 됨 |
| 외부 호스팅 | 제공사별 확인 | 추론 API와 전용 엔드포인트는 토큰, 시간 또는 인스턴스 단위로 과금됩니다. 지역·정밀도·제공사별 변동 |
최근 확인일 2026.08.11 · 실제 이용 전 공식 페이지를 다시 확인하세요.
04
도입 전 확인 사항
입력 데이터 경로, 제작 국가와 공급망, 가중치 라이선스, 생성 결과의 권리와 한국어 업무 품질을 구분해 확인하세요.
입력 데이터와 학습
자체 호스팅하면 입력이 모델 개발사로 자동 전송되지 않습니다. 외부 API나 호스팅을 쓰면 해당 제공사의 로그, 보존과 학습 정책이 별도로 적용됩니다.
개발·운영 주체
중국계 개발 주체의 모델입니다. 가중치를 자체 호스팅하면 프롬프트가 개발사 서비스로 자동 전송되지는 않지만, 공급망·라이선스·기관 정책은 별도로 검토해야 합니다.
가중치·결과물 권리
Modified MIT는 주로 가중치와 배포 조건을 다룹니다. 생성 결과의 저작권 성립과 제3자 권리 침해 여부까지 보장하는 것은 아니므로 상업 이용 전 별도 검토가 필요합니다.
한국어·국내 업무
한국어 생성 가능 여부와 국내 업무 적합성은 다릅니다. 존댓말, 문서 문체, 고유명사와 숫자 보존을 대표 자료로 별도 평가하세요.
실행 환경
1.06T 가중치의 단순 용량 외에 KV cache, 활성값, 배치와 런타임 오버헤드가 필요합니다. 256K 문맥을 실제 운영할 때는 동시 사용자 수까지 포함해 산정하세요.
05
이런 경우에 적합합니다
잘 맞는 경우
- 텍스트·코드·추론 작업에 맞는 자체 호스팅 모델을 찾는 개발팀
- Modified MIT 조건을 검토하고 가중치를 직접 운영하려는 조직
- 1.06T 규모의 품질과 인프라 비용을 실제 데이터로 평가하려는 팀
먼저 확인할 경우
- 1.06T 가중치의 단순 용량 외에 KV cache, 활성값, 배치와 런타임 오버헤드가 필요합니다. 256K 문맥을 실제 운영할 때는 동시 사용자 수까지 포함해 산정하세요.
- 모델 카드의 벤치마크만으로 한국어 업무 품질을 단정하지 말고 대표 문서와 실패 사례를 포함해 평가해야 합니다.
- 외부 호스팅을 선택하면 오픈웨이트 여부와 별개로 해당 제공사의 데이터 처리·과금 조건이 적용됩니다.
06
다음으로 볼 정보
관련 글·출처
관련 글과 출처
기능, 요금과 이용 조건을 더 자세히 확인할 수 있는 자료입니다.