한 줄 결론: DeepSeek V4 GA는 MIT 오픈소스 + 100만 토큰 컨텍스트 + SWE-bench Verified 80.6% 오픈소스 최고 기록으로, 클로즈드 플래그십 대비 약 1/10~1/100 비용에 오픈소스 최강 성능을 제공합니다. 본 글은 타임라인, 기술 아키텍처(CSA/HCA/mHC/Muon), 벤치마크, GPT-5.6·Claude Fable 5 대비, 피크·오프피크 요금, 7월 24일 API 마이그레이션 여섯 축으로 정리하며 6단계 Runbook과 FAQ를 포함합니다. 프라이빗 배포가 필요하면 ds4 고메모리 Mac 클라우드 추론 가이드를 함께 참고하세요.
00DeepSeek V4 GA란 무엇인가
DeepSeek V4 GA(General Availability)는 2026년 7월 20일 프로덕션에 공개된 대규모 언어 모델 패밀리입니다. V4-Pro(1.6T 파라미터)와 V4-Flash(284B 파라미터) 두 스펙으로 구성되며, 모두 MIT 라이선스로 오픈소스화되어 100만 토큰 컨텍스트와 최대 384K 토큰 출력을 지원합니다.
4월 프리뷰 대비 GA는 Agent 작업, 수학 추론, 코드 생성을 전문적으로 강화했고 정식 상업화 과금 체계인 피크·오프피크 차등 요금을 도입했습니다. 구 인터페이스명 deepseek-chat과 deepseek-reasoner는 7월 24일 영구 중단됩니다.
- 오픈소스·셀프호스트: MIT 라이선스로 기업이 데이터 반출 규제에 맞춰 프라이빗 배포할 수 있습니다.
- 100만 토큰 컨텍스트 실측 가능: KV Cache 메모리는 V3.2 대비 10%(Flash는 7%)에 불과합니다.
- 오픈소스 SWE-bench 기록: Verified 80.6%로 Gemini 3.1 Pro와 공동 1위입니다.
- 극한 API 가성비: V4-Pro 출력 오프피크 $0.87/M, 피크 $1.74/M로 Claude Fable 5의 약 1/57 수준입니다.
01타임라인: 프리뷰에서 GA까지
| 일자 | 이벤트 |
|---|---|
| 2026-04-24 | V4 프리뷰 출시 및 오픈소스(MIT), V4-Pro(1.6T)·V4-Flash(284B) 포함 |
| 2026-05 | 프로덕션 튜닝 버전 출시, API 정식 가용 |
| 2026-06 | V4-Pro 가격 영구 75% 인하(출력 $0.87/M tokens) |
| 2026-06-29 | 전체 API 사용자에 GA 7월 중순 출시 및 피크·오프피크 요금 최초 공개 메일 발송 |
| 2026-07-19 | 다수 개발자 GA 그레이스케일 자격 획득, 언론은 「풀스펙 버전 내일 출시」 보도 |
| 2026-07-20 | GA 정식판 출시(본문 발행일) |
| 2026-07-24 | 구 인터페이스 deepseek-chat / deepseek-reasoner 영구 중단 |
02기술 아키텍처 심층 분석
모델 패밀리 개요
| 사양 | V4-Pro | V4-Flash |
|---|---|---|
| 총 파라미터 | 1.6조(1.6T) | 2,840억(284B) |
| 토큰당 활성 파라미터 | 490억(49B) | 130억(13B) |
| Transformer 층수 | 61층 | 43층 |
| 컨텍스트 윈도우 | 1,000,000 tokens | 1,000,000 tokens |
| 최대 출력 | 384K tokens | 384K tokens |
| 정밀도 | FP4(전문가 가중치) + FP8(기타) | FP4 + FP8 혼합 |
| 사전학습 데이터 | 33T+ tokens | 32T+ tokens |
| 오픈소스 라이선스 | MIT | MIT |
하이브리드 어텐션(CSA + HCA)
DeepSeek V4는 V2/V3 시대의 MLA를 버리고 두 가지 신규 어텐션 메커니즘의 하이브리드를 채택했습니다.
압축 희소 어텐션(CSA): KV 시퀀스를 Softmax 게이트 풀링으로 4배 압축한 뒤 FP4 「라이트닝 인덱서」로 top-k 희소 선택(Pro는 top-1024, Flash는 top-512)을 수행하며 최근 128 토큰 슬라이딩 윈도우를 유지합니다. 100만 토큰 컨텍스트에서 V3.2 대비 27% 추론 FLOPs만 필요합니다.
고압축 어텐션(HCA): 토큰을 128배 압축한 뒤 글로벌 밀집 어텐션으로 장거리 의존성을 포착합니다. Flash는 초기 2층에 HCA를 쓰고 이후 CSA/HCA를 교대하며, Pro도 유사한 구조입니다.
종합 효과: 100만 토큰 시나리오에서 KV Cache 메모리는 V3.2의 10%(Flash는 7%)에 그칩니다.
다양체 제약 초연결(mHC)과 Muon 옵티마이저
mHC는 기존 잔차 연결을 업그레이드해 4채널 잔차 스트림과 이중 확률 행렬 제약(Birkhoff 다면체)을 도입, 61층 심층 네트워크에서 신호가 안정적으로 전파되도록 합니다. Muon 옵티마이저는 뉴턴-슐츠 직교화로 그래디언트를 처리해 수렴이 빠르고 학습이 안정적입니다.
세 가지 추론 모드
| 모드 | 특징 | 적합 시나리오 |
|---|---|---|
| Non-think | 사고 체인 없음, 초고속 응답 | 단순 Q&A, 라우팅 분기 |
| Think High | 명시적 추론(<redacted_thinking> 태그) | 중간 복잡도 작업, 코드 디버깅 |
| Think Max | 최대 추론 강도, 384K+ 컨텍스트 필요 | 복잡한 수학, 장시간 Agent |
공식 권장 샘플링 파라미터: temperature=1.0, top_p=1.0(모든 모드 공통).
03벤치마크: 오픈소스 최고 성적표
| 벤치마크 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6%(오픈소스 최고) | 96.0% | 별도 미공개 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified는 실제 GitHub 저장소 버그 수정을 측정하며, 80.6%가 현재 오픈소스 모델 최고점입니다. SWE-bench Pro는 더 엄격하며 Claude Fable 5가 80.3%로 선두입니다.
가성비 횡단 비교
Artificial Analysis 평가 데이터(Strategy & Ops 지수 작업):
- Claude Fable 5: 호출당 $3.48, 점수 50점
- DeepSeek V4-Pro: 호출당 $0.03, 점수 38점
- DeepSeek V4-Flash: 6개 지수 작업 모두 호출당 $0.04 미만
Fable 5 비용은 V4-Pro의 116배인데 점수는 약 12점(31%)만 높습니다. Kimi K3 리뷰와 대조하면 K3는 파라미터가 더 크지만 API 출력 $15/M로, 비용 민감 시나리오에서 V4-Pro가 여전히 압도적 우위를 유지합니다.
04GPT-5.6·Claude Fable 5 전면 비교
| 차원 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 오픈소스 | MIT 라이선스 | 클로즈드 | 클로즈드 |
| 셀프호스트 | 지원 | 미지원 | 미지원 |
| 컨텍스트 윈도우 | 1M tokens | 미공개 | 1M tokens |
| 코드 역량 | 매우 강함(Fable 5에 근접) | 매우 강함 | 최강 |
| API 출력가(오프피크) | $0.87/M tokens | ~$15/M | $50/M |
| 피크 출력가 | $1.74/M tokens | — | — |
| Agent 역량 | 강함, 다중 Agent 오케스트레이션 지원 | 강함 | 최강 |
| 데이터 프라이버시 | 프라이빗 배포 가능 | 미지원 | 미지원 |
선정 가이드:
- 예산 제약·고빈도 호출·프라이빗 배포: V4-Pro 또는 V4-Flash 우선
- 극한 코드 역량·비용 무관: Claude Fable 5(SWE-bench Pro 최고점)
- 복잡 알고리즘·수학 추론: GPT-5.6 Sol / Ultra
- 초대규모 로그·문서 처리: V4-Flash(캐시 히트 입력 $0.0028/M)
05피크·오프피크 요금: 비용 절감 전략
GA에서 가장 주목받는 변화는 DeepSeek이 피크·오프피크 차등 요금을 처음 도입한 것입니다. 전력 요금제와 유사합니다. 피크 시간대(베이징 시간): 평일 09:00–12:00, 14:00–18:00에 요율이 2배입니다.
| 모델 | 과금 항목 | 오프피크(Off-Peak) | 피크(Peak) |
|---|---|---|---|
| V4-Pro | 입력(캐시 히트) | ¥0.025 / $0.0035 / 1M | 2배 |
| 입력(캐시 미스) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 | |
| 출력 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 | |
| V4-Flash | 입력(캐시 히트) | ¥0.02 / $0.0028 / 1M | 2배 |
| 입력(캐시 미스) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 | |
| 출력 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
절감 네 가지 전략:
- 비실시간 작업은 오프피크(18:00 이후 또는 09:00 이전)로 스케줄링합니다.
- Prompt Cache를 적극 활용합니다. V4-Flash 캐시 히트는 $0.0028/M에 불과합니다.
- Flash로 트래픽을 분기합니다. 단순 라우팅은 Flash, 복잡 추론은 Pro로 에스컬레이션합니다.
- 요금 변경 메일을 주시합니다. DeepSeek은 24시간 전 사전 통지를 약속했습니다.
피크 시간대에도 V4-Pro 출력 $1.74/M는 Claude Opus 4.8($15/M)보다 8.6배 저렴합니다.
06API 마이그레이션 가이드(7월 24일 마감)
deepseek-chat과 deepseek-reasoner는 2026년 7월 24일 15:59 UTC(베이징 시간 23:59)에 영구 중단됩니다.| 구 모델명 | 신 모델명 | 비고 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(Non-think 모드) | 고속, 경량 작업에 적합 |
deepseek-reasoner | deepseek-v4-flash(Think 모드) | 또는 deepseek-v4-pro로 업그레이드해 더 강한 추론 |
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
)
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
V4는 OpenAI ChatCompletions와 Anthropic Messages 형식을 모두 지원합니다. base_url은 동일하며 model 파라미터만 갱신하면 됩니다.
076단계 Runbook: V4 GA 프로덕션 연동
-
01
코드베이스 감사:
deepseek-chat과deepseek-reasoner를 전역 검색해 모든 호출 지점과 환경 변수를 나열합니다. -
02
목표 모델 선택: 경량 대화는
deepseek-v4-flash, 복잡 Agent·코드는deepseek-v4-pro로 라우팅합니다. Think 모드는extra_body로 활성화합니다. -
03
스테이징 스모크 테스트: 7월 24일 전에 프리프로덕션에서 Non-think / Think High / Think Max 세 모드 출력 품질을 검증합니다.
-
04
피크·오프피크 스케줄 구성: 배치 문서 처리·코드 리뷰 등 오프라인 작업을 18:00 이후 또는 주말 cron으로 배치하고 캐시 히트율 80%+를 목표로 합니다.
-
05
Flash→Pro 라우팅 구축: 의도 분류와 FAQ는 Flash(출력 $0.28/M), 복잡 추론만 Pro로 에스컬레이션합니다.
-
06
Agent 호스트 배포: 장시간 V4 Agent 세션에는 안정적 SSH와 이웃 간 연산 경쟁이 없는 환경이 필요합니다. 요금 페이지에서 NUKCLOUD 독점 Mac 노드를 CI·Agent 빌드 플랫폼으로 평가해 공유 풀 꼬리 지연이 API 비용 절감을 상쇄하지 않도록 합니다.
08요약 및 FAQ
DeepSeek V4 GA는 2026년 오픈소스 LLM 분야에서 가장 중요한 이정표 중 하나입니다. 가치는 Claude Fable 5나 GPT-5.6을 당장 이기는 데 있지 않고, 클로즈드 플래그십의 1/10~1/100 비용으로 오픈소스 최강 성능을 제공한다는 점에 있습니다. 피크·오프피크 요금은 비용 복잡도를 높이지만 본질적으로 여전히 경쟁력이 큽니다. DeepSeek이 「가격 파괴자」에서 「규칙 있는 상업 플랫폼」으로 전환한 것은 성숙화 신호입니다.
팀이 V4로 대규모 코드베이스에 장시간 Agent 호출을 돌릴 때는 안정적이고 감사 가능한 로컬 개발·CI 플랫폼이 여전히 필요합니다. 공유 분 단위 풀, 책상 아래 Mac, 오버서브스크립션 VPS에서는 대역 지터·이웃 CPU 경쟁·장시간 연결 끊김이 토큰 인하 효과를 빠르게 잠식합니다. 더 안정적인 프로덕션 Agent 호스트가 필요하면 NUKCLOUD 다리전 베어메탈 Mac / 클라우드 Mac 노드가 독점 Apple Silicon 연산과 명확한 테넌트 경계를 제공합니다. 요금 페이지에서 사양을 확인하고 주문 페이지로 시험 환경을 프로비저닝하세요.
deepseek-v4-flash 또는 deepseek-v4-pro로 마이그레이션해야 합니다.데이터 기준: 2026-07-20. 출처: DeepSeek 공식 문서, arXiv:2606.19348, HuggingFace 모델 페이지, LLMReference, Artificial Analysis, MangoMind Blog.