한 줄 결론: Grok 4.6은 아직 공식 제품으로 존재하지 않는 상태에 가깝습니다. 목표는 8월 7일 전후, 규모는 약 1.5조 파라미터, 후학습에서 SFT·RL을 두껍게 쌓는다——이것이 머스크 발표의 전부입니다. 4.5 API 연동을 막 끝낸 팀도 K3 2.8T 오픈웨이트와 8월 Fable 5.1 루머를 함께 고려해야 합니다. 아래에 타임라인, 스펙 표,痛点, 경쟁 매트릭스, 6단계 Runbook, FAQ를 담았습니다.
007월 가속: 4.5에서 4.6까지 20일
| 날짜 | 사건 |
|---|---|
| 7월 8일 | xAI Grok 4.5 출시. API 입력 $2/M·출력 $6/M, 컨텍스트 50만 token, Cursor 공동 학습. Terminal-Bench 2.1 83.3%, SWE-Bench Pro 64.7%. |
| 7월 16~26일 | Moonshot Kimi K3가 API에서 2.8T 풀 오픈웨이트로 확장. K3 전면 공개 참고. |
| 7월 | xAI가 Grok으로 CSAM 생성 혐의 사용자를 상대로 소송 제기——안전장치 한계 사례로 엔터프라이즈 벤더 리스크 표에 반영 필요. |
| 7월 28일 | 머스크 @rauchg 답글: 4.6 약 8월 7일(1.5T·SFT/RL), 4.7 8월 말~9월 초(2.1T·느리지만 강함). 당일 1100명+ 「Pacing the Frontier」 서명, xAI는 명단에 없음. |
| 8월(미확인) | Anthropic Claude Fable 5.1 동시기 출시 루머——공식 발표 없음. |
| 7월 30일 | 4.6 기술 블로그·요금·벤치 제로. 스펙은 트윗 의존. |
01공식 데이터 vs 머스크 예고 분리
| 항목 | Grok 4.5(확인) | Grok 4.6(예고·미검증) | Grok 4.7(예고·미검증) |
|---|---|---|---|
| 출시일 | 2026-07-08 | 약 2026-08-07 | 8월 말 – 9월 초 |
| 파라미터 | 비공개 MoE | 약 1.5T | 약 2.1T |
| 후학습 초점 | Cursor 공동·Agent 최적화 | SFT + RL 대폭 강화 | 더 대규모·저속 |
| 컨텍스트 | 500K | 미공개 | 미공개 |
| API 요금 | $2 / $6 per M | 미공개 | 미공개 |
| 독립 벤치 | 15항목 공개 | — | — |
4.5 출시 때는 모델 카드와 15개 벤치가 동시에 나왔습니다. 4.6은 제3자 평가가 전무합니다. 머스크가 「사전학습 확대보다 후학습(SFT·RL)」을 강조한다면 코딩 Agent 작업 완료율이 첫 승부처일 수 있으나, 이 역시 추측에 그칩니다.
痛点8월 모델 계획이 어려운 이유
- 조달 일정이 트윗에 묶임: xAI 제품 페이지·changelog 없이 8월 스프린트를 4.6 전제로 짜면 고위험입니다.
- 플래그십 유통기한: 4.5 프롬프트 튜닝이 끝나기 전에 차세대가 옵니다. 벤치 우위 증명 전에 이전 비용만 발생합니다.
- 파라미터 비교 함정: 1.5T와 K3 2.8T는 MoE 활성 파라미터·후학습 품질·컨텍스트 없이는 비교 불가.
- 듀얼 SKU 혼란: 4.6(빠름)과 4.7(강하지만 느림)이 동시 예고, 어느 쪽을 기다릴지·API model ID·가격 차는 불명.
- 폐쇄 vs 오픈웨이트: xAI는 폐쇄 API만. Kimi K3는 자체 호스팅 가능. 데이터 레지던시·벤더 락인 병행 평가.
- 컴플라이언스 부담: 7월 CSAM 소송과 아동 안전 논쟁이 출시 가속과 동시 진행, 법무 검토가 기술 사이클보다 길어질 수 있음.
- 업계 양극화: 당일 「Pacing the Frontier」는 감속을, xAI는 20일 주기 가속을——분기 리듬 없는 예산·검증 인력은 붕괴하기 쉽습니다.
02경쟁 매트릭스: 4.6이 넘어야 할 기준선
| 모델 | 파라미터 | 컨텍스트 | SWE-Bench Pro | Terminal-Bench 2.1 | 형태 |
|---|---|---|---|---|---|
| Grok 4.5 | 비공개 MoE | 500K | 64.7% | 83.3% | 폐쇄 API / Cursor |
| Kimi K3 | 2.8T 오픈웨이트 | 1M | 93.4%(Vals Verified) | — | API + 자체 호스팅 |
| Claude Fable 5.1 | 비공개 | 200K+ | ~80%급(Fable 5 약 80.4%) | 84.3%(Fable 5) | 폐쇄 API(8월 루머) |
| Grok 4.6(예고) | ~1.5T(미검증) | 미공개 | — | — | 폐쇄 API 예상 |
요금·태스크당 비용(4.5 확정)
| 모델 | 입출력(per M) | 코딩 Agent 1태스크(참고) |
|---|---|---|
| Grok 4.5 | $2 / $6 | 약 $2.49 |
| Kimi K3 | $0.30(캐시)– $3 / $15 | 약 $0.95 |
| Claude Fable 5 | 고가 | 약 $11.80 |
| Grok 4.6 | 미공개 | — |
03Grok 4.7: 두 번째 대형 파도
머스크는 4.7을 4.6 위의 「능력판」으로 둡니다. 약 2.1T, 지연은 희생하고 품질·token 효율을 취하는 구조——출시는 8월 말~9월 초. 8월만 두 SKU가 나올 수 있어 Fast/Max 이층 전략처럼 보이지만 명칭·API ID는 미발표입니다.
실무에서는 4.6=저지연 고빈도 Agent(CI 수정, 터미널 작업), 4.7=품질 중심 장추론(설계, 대규모 리팩터)로 나누는 것이 현실적입니다. 공식 벤치 전에는 Kimi K3나 GPT-6 로비 폐쇄 플래그십을 반드시 이긴다고 가정하면 안 됩니다.
046단계 Runbook: 4.6 출시 전 준비
-
01
4.5 베이스라인 고정: Cursor/API SWE 스모크, 태스크당 token·P95 지연을 기록해 4.6 A/B에 사용합니다. 4.5 벤치 해설 참고.
-
02
공식 채널 알림: xAI changelog,
api.x.ai모델 목록, Grok Build 공지 모니터링. 8월 7일 전후 SNS 재전보가 아닌 1차 정보로 확인합니다. -
03
3경로 라우팅 초안: 4.6(빠름)/4.7(강함)/Kimi K3(장컨텍스트 OSS). 독립 벤치 전 4.5 프로덕션 트래픽을 끄지 마세요.
-
04
예산 버퍼: 4.5 $2/$6로 8월 사용량 추정, 인상·상위 SKU 분리에 15~25% 여유. NUKCLOUD 가격과 Agent 호스트·CI 고정비 합산.
-
05
벤더 자체 보고 대신 제3자: 4.6 이후 Vals AI, Artificial Analysis 등 SWE-Bench/Terminal-Bench 재현을 기다린 뒤 코어 파이프라인 이전을 결정합니다.
-
06
조직 페이스 조정: 「Pacing the Frontier」 맥락을 읽고, 20일 주기가 팀 소화력을 넘으면 분기 리뷰로 전환해 「최신 Grok 필수」 정책을 동결합니다.
05요약 및 FAQ
Grok 4.6은 「7월 최고속 이터레이션」 서사의 연장입니다. 4.5 후 20일 만에 1.5T+SFT/RL과 2.1T 4.7이 예고되고, 8월은 Fable 5.1 루머와 겹칩니다. 엔지니어링 팀에게 중요한 것은 8월 7일 선점이 아니라 재현 가능한 베이스라인, 독립 벤치, 폐쇄 Grok과 오픈웨이트 K3 사이 라우팅 유연성입니다.
고빈도 Grok Agent를 공유 VPS·오버셀 클라우드에서 돌리면 CPU 경합·SSH 끊김·빌드 큐 지터가 모델 단가 이점을 금방 없앱니다. 안정적인 터미널 Bench·CI 평면이 필요한 팀에는 NUKCLOUD 멀티리전 베어메탈 Mac/클라우드 Mac이 전용 Apple Silicon과 명확한 테넌트 경계를 제공합니다. 가격 페이지에서 사양을 확인하고 주문 페이지에서 Agent 호스트 환경을 시험해 보세요.
데이터 기준 2026-07-30. 출처: 머스크 X 게시, xAI Grok 4.5 공식, Grok 4.5 리뷰, Kimi K3 기사. 4.6/4.7 스펙은 예고 단계.