DeepSeek V4 GA 정식 출시: 요금·아키텍처·GPT-5.6 대비 성능 격차 완전 해설

3개월의 대기 끝에 DeepSeek V4 GA(정식판)가 2026년 7월 20일 프로덕션에 올라왔습니다. Agent 역량이 전면 강화되었고, 피크·오프피크 차등 요금이 처음 도입되어 DeepSeek은 「거의 무료」에서 체계적인 상업 운영 단계로 진입했습니다.

한 줄 결론: DeepSeek V4 GA는 MIT 오픈소스 + 100만 토큰 컨텍스트 + SWE-bench Verified 80.6% 오픈소스 최고 기록으로, 클로즈드 플래그십 대비 약 1/10~1/100 비용에 오픈소스 최강 성능을 제공합니다. 본 글은 타임라인, 기술 아키텍처(CSA/HCA/mHC/Muon), 벤치마크, GPT-5.6·Claude Fable 5 대비, 피크·오프피크 요금, 7월 24일 API 마이그레이션 여섯 축으로 정리하며 6단계 Runbook과 FAQ를 포함합니다. 프라이빗 배포가 필요하면 ds4 고메모리 Mac 클라우드 추론 가이드를 함께 참고하세요.

00DeepSeek V4 GA란 무엇인가

DeepSeek V4 GA(General Availability)는 2026년 7월 20일 프로덕션에 공개된 대규모 언어 모델 패밀리입니다. V4-Pro(1.6T 파라미터)V4-Flash(284B 파라미터) 두 스펙으로 구성되며, 모두 MIT 라이선스로 오픈소스화되어 100만 토큰 컨텍스트와 최대 384K 토큰 출력을 지원합니다.

4월 프리뷰 대비 GA는 Agent 작업, 수학 추론, 코드 생성을 전문적으로 강화했고 정식 상업화 과금 체계인 피크·오프피크 차등 요금을 도입했습니다. 구 인터페이스명 deepseek-chatdeepseek-reasoner7월 24일 영구 중단됩니다.

  • 오픈소스·셀프호스트: MIT 라이선스로 기업이 데이터 반출 규제에 맞춰 프라이빗 배포할 수 있습니다.
  • 100만 토큰 컨텍스트 실측 가능: KV Cache 메모리는 V3.2 대비 10%(Flash는 7%)에 불과합니다.
  • 오픈소스 SWE-bench 기록: Verified 80.6%로 Gemini 3.1 Pro와 공동 1위입니다.
  • 극한 API 가성비: V4-Pro 출력 오프피크 $0.87/M, 피크 $1.74/M로 Claude Fable 5의 약 1/57 수준입니다.

01타임라인: 프리뷰에서 GA까지

일자이벤트
2026-04-24V4 프리뷰 출시 및 오픈소스(MIT), V4-Pro(1.6T)·V4-Flash(284B) 포함
2026-05프로덕션 튜닝 버전 출시, API 정식 가용
2026-06V4-Pro 가격 영구 75% 인하(출력 $0.87/M tokens)
2026-06-29전체 API 사용자에 GA 7월 중순 출시 및 피크·오프피크 요금 최초 공개 메일 발송
2026-07-19다수 개발자 GA 그레이스케일 자격 획득, 언론은 「풀스펙 버전 내일 출시」 보도
2026-07-20GA 정식판 출시(본문 발행일)
2026-07-24구 인터페이스 deepseek-chat / deepseek-reasoner 영구 중단
핵심 변화: 프리뷰도 강력했지만 GA는 Agent·수학·코드 역량을 추가로 끌어올리고 피크·오프피크 요금과 구 API 폐기 일정을 확정했습니다. V4-Pro 75% 인하 해설은 6월 AI 요금 인하 총정리를 참고하세요.

02기술 아키텍처 심층 분석

모델 패밀리 개요

사양V4-ProV4-Flash
총 파라미터1.6조(1.6T)2,840억(284B)
토큰당 활성 파라미터490억(49B)130억(13B)
Transformer 층수61층43층
컨텍스트 윈도우1,000,000 tokens1,000,000 tokens
최대 출력384K tokens384K tokens
정밀도FP4(전문가 가중치) + FP8(기타)FP4 + FP8 혼합
사전학습 데이터33T+ tokens32T+ tokens
오픈소스 라이선스MITMIT

하이브리드 어텐션(CSA + HCA)

DeepSeek V4는 V2/V3 시대의 MLA를 버리고 두 가지 신규 어텐션 메커니즘의 하이브리드를 채택했습니다.

압축 희소 어텐션(CSA): KV 시퀀스를 Softmax 게이트 풀링으로 4배 압축한 뒤 FP4 「라이트닝 인덱서」로 top-k 희소 선택(Pro는 top-1024, Flash는 top-512)을 수행하며 최근 128 토큰 슬라이딩 윈도우를 유지합니다. 100만 토큰 컨텍스트에서 V3.2 대비 27% 추론 FLOPs만 필요합니다.

고압축 어텐션(HCA): 토큰을 128배 압축한 뒤 글로벌 밀집 어텐션으로 장거리 의존성을 포착합니다. Flash는 초기 2층에 HCA를 쓰고 이후 CSA/HCA를 교대하며, Pro도 유사한 구조입니다.

종합 효과: 100만 토큰 시나리오에서 KV Cache 메모리는 V3.2의 10%(Flash는 7%)에 그칩니다.

다양체 제약 초연결(mHC)과 Muon 옵티마이저

mHC는 기존 잔차 연결을 업그레이드해 4채널 잔차 스트림과 이중 확률 행렬 제약(Birkhoff 다면체)을 도입, 61층 심층 네트워크에서 신호가 안정적으로 전파되도록 합니다. Muon 옵티마이저는 뉴턴-슐츠 직교화로 그래디언트를 처리해 수렴이 빠르고 학습이 안정적입니다.

세 가지 추론 모드

모드특징적합 시나리오
Non-think사고 체인 없음, 초고속 응답단순 Q&A, 라우팅 분기
Think High명시적 추론(<redacted_thinking> 태그)중간 복잡도 작업, 코드 디버깅
Think Max최대 추론 강도, 384K+ 컨텍스트 필요복잡한 수학, 장시간 Agent

공식 권장 샘플링 파라미터: temperature=1.0, top_p=1.0(모든 모드 공통).

03벤치마크: 오픈소스 최고 성적표

벤치마크DeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6%(오픈소스 최고)96.0%별도 미공개~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

SWE-bench Verified는 실제 GitHub 저장소 버그 수정을 측정하며, 80.6%가 현재 오픈소스 모델 최고점입니다. SWE-bench Pro는 더 엄격하며 Claude Fable 5가 80.3%로 선두입니다.

가성비 횡단 비교

Artificial Analysis 평가 데이터(Strategy & Ops 지수 작업):

  • Claude Fable 5: 호출당 $3.48, 점수 50점
  • DeepSeek V4-Pro: 호출당 $0.03, 점수 38점
  • DeepSeek V4-Flash: 6개 지수 작업 모두 호출당 $0.04 미만

Fable 5 비용은 V4-Pro의 116배인데 점수는 약 12점(31%)만 높습니다. Kimi K3 리뷰와 대조하면 K3는 파라미터가 더 크지만 API 출력 $15/M로, 비용 민감 시나리오에서 V4-Pro가 여전히 압도적 우위를 유지합니다.

04GPT-5.6·Claude Fable 5 전면 비교

차원DeepSeek V4-ProGPT-5.6 SolClaude Fable 5
오픈소스MIT 라이선스클로즈드클로즈드
셀프호스트지원미지원미지원
컨텍스트 윈도우1M tokens미공개1M tokens
코드 역량매우 강함(Fable 5에 근접)매우 강함최강
API 출력가(오프피크)$0.87/M tokens~$15/M$50/M
피크 출력가$1.74/M tokens
Agent 역량강함, 다중 Agent 오케스트레이션 지원강함최강
데이터 프라이버시프라이빗 배포 가능미지원미지원

선정 가이드:

  • 예산 제약·고빈도 호출·프라이빗 배포: V4-Pro 또는 V4-Flash 우선
  • 극한 코드 역량·비용 무관: Claude Fable 5(SWE-bench Pro 최고점)
  • 복잡 알고리즘·수학 추론: GPT-5.6 Sol / Ultra
  • 초대규모 로그·문서 처리: V4-Flash(캐시 히트 입력 $0.0028/M)

05피크·오프피크 요금: 비용 절감 전략

GA에서 가장 주목받는 변화는 DeepSeek이 피크·오프피크 차등 요금을 처음 도입한 것입니다. 전력 요금제와 유사합니다. 피크 시간대(베이징 시간): 평일 09:00–12:00, 14:00–18:00에 요율이 2배입니다.

모델과금 항목오프피크(Off-Peak)피크(Peak)
V4-Pro입력(캐시 히트)¥0.025 / $0.0035 / 1M2배
입력(캐시 미스)¥3.00 / $0.435 / 1M¥6.00 / $0.87
출력¥6.00 / $0.87 / 1M¥12.00 / $1.74
V4-Flash입력(캐시 히트)¥0.02 / $0.0028 / 1M2배
입력(캐시 미스)¥1.00 / $0.14 / 1M¥2.00 / $0.28
출력¥2.00 / $0.28 / 1M¥4.00 / $0.56

절감 네 가지 전략:

  1. 비실시간 작업은 오프피크(18:00 이후 또는 09:00 이전)로 스케줄링합니다.
  2. Prompt Cache를 적극 활용합니다. V4-Flash 캐시 히트는 $0.0028/M에 불과합니다.
  3. Flash로 트래픽을 분기합니다. 단순 라우팅은 Flash, 복잡 추론은 Pro로 에스컬레이션합니다.
  4. 요금 변경 메일을 주시합니다. DeepSeek은 24시간 전 사전 통지를 약속했습니다.

피크 시간대에도 V4-Pro 출력 $1.74/M는 Claude Opus 4.8($15/M)보다 8.6배 저렴합니다.

06API 마이그레이션 가이드(7월 24일 마감)

중요: 구 모델명 deepseek-chatdeepseek-reasoner2026년 7월 24일 15:59 UTC(베이징 시간 23:59)에 영구 중단됩니다.
구 모델명신 모델명비고
deepseek-chatdeepseek-v4-flash(Non-think 모드)고속, 경량 작업에 적합
deepseek-reasonerdeepseek-v4-flash(Think 모드)또는 deepseek-v4-pro로 업그레이드해 더 강한 추론
Python OpenAI SDK 마이그레이션 예시
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
)
Anthropic SDK 호환 작성법
client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

V4는 OpenAI ChatCompletions와 Anthropic Messages 형식을 모두 지원합니다. base_url은 동일하며 model 파라미터만 갱신하면 됩니다.

076단계 Runbook: V4 GA 프로덕션 연동

  1. 01
    코드베이스 감사: deepseek-chatdeepseek-reasoner를 전역 검색해 모든 호출 지점과 환경 변수를 나열합니다.
  2. 02
    목표 모델 선택: 경량 대화는 deepseek-v4-flash, 복잡 Agent·코드는 deepseek-v4-pro로 라우팅합니다. Think 모드는 extra_body로 활성화합니다.
  3. 03
    스테이징 스모크 테스트: 7월 24일 전에 프리프로덕션에서 Non-think / Think High / Think Max 세 모드 출력 품질을 검증합니다.
  4. 04
    피크·오프피크 스케줄 구성: 배치 문서 처리·코드 리뷰 등 오프라인 작업을 18:00 이후 또는 주말 cron으로 배치하고 캐시 히트율 80%+를 목표로 합니다.
  5. 05
    Flash→Pro 라우팅 구축: 의도 분류와 FAQ는 Flash(출력 $0.28/M), 복잡 추론만 Pro로 에스컬레이션합니다.
  6. 06
    Agent 호스트 배포: 장시간 V4 Agent 세션에는 안정적 SSH와 이웃 간 연산 경쟁이 없는 환경이 필요합니다. 요금 페이지에서 NUKCLOUD 독점 Mac 노드를 CI·Agent 빌드 플랫폼으로 평가해 공유 풀 꼬리 지연이 API 비용 절감을 상쇄하지 않도록 합니다.

08요약 및 FAQ

DeepSeek V4 GA는 2026년 오픈소스 LLM 분야에서 가장 중요한 이정표 중 하나입니다. 가치는 Claude Fable 5나 GPT-5.6을 당장 이기는 데 있지 않고, 클로즈드 플래그십의 1/10~1/100 비용으로 오픈소스 최강 성능을 제공한다는 점에 있습니다. 피크·오프피크 요금은 비용 복잡도를 높이지만 본질적으로 여전히 경쟁력이 큽니다. DeepSeek이 「가격 파괴자」에서 「규칙 있는 상업 플랫폼」으로 전환한 것은 성숙화 신호입니다.

팀이 V4로 대규모 코드베이스에 장시간 Agent 호출을 돌릴 때는 안정적이고 감사 가능한 로컬 개발·CI 플랫폼이 여전히 필요합니다. 공유 분 단위 풀, 책상 아래 Mac, 오버서브스크립션 VPS에서는 대역 지터·이웃 CPU 경쟁·장시간 연결 끊김이 토큰 인하 효과를 빠르게 잠식합니다. 더 안정적인 프로덕션 Agent 호스트가 필요하면 NUKCLOUD 다리전 베어메탈 Mac / 클라우드 Mac 노드가 독점 Apple Silicon 연산과 명확한 테넌트 경계를 제공합니다. 요금 페이지에서 사양을 확인하고 주문 페이지로 시험 환경을 프로비저닝하세요.

DeepSeek V4 GA와 프리뷰 버전의 차이는 무엇인가요?
GA는 Agent·수학 추론·코드 생성을 전문적으로 강화했고 피크·오프피크 요금을 도입했습니다. 기반 1.6T MoE 아키텍처는 동일하지만 프로덕션 안정성과 상업화 체계가 갖춰졌습니다.
피크·오프피크 요금의 피크 시간대는 언제인가요?
베이징 시간 평일 09:00–12:00과 14:00–18:00에 요율이 2배입니다. 그 외는 오프피크입니다. 배치 작업은 18:00 이후로 배치하는 것이 좋습니다.
deepseek-chat는 언제 중단되나요?
2026년 7월 24일 15:59 UTC(베이징 시간 23:59)에 영구 중단됩니다. deepseek-v4-flash 또는 deepseek-v4-pro로 마이그레이션해야 합니다.
DeepSeek V4를 로컬에 배포할 수 있나요?
가능합니다. MIT 라이선스로 오픈소스입니다. 고메모리 Apple Silicon에서 Flash 변형을 실행할 수 있으며, ds4 로컬 추론 Runbook을 참고하세요.
DeepSeek V4와 GPT-5.6 중 어느 쪽이 더 경제적인가요?
V4-Pro 출력은 오프피크 $0.87/M, 피크 $1.74/M로 GPT-5.6 Sol(~$15/M)의 약 1/17 수준입니다. SWE-bench Verified 오픈소스 기록 80.6%로 가성비가 압도적입니다.
Agent CI는 어떤 인프라에서 돌려야 하나요?
장시간 V4 Agent에는 안정적 SSH, 예측 가능한 디스크 IO, 이웃 간 연산 경쟁이 없는 환경이 필요합니다. NUKCLOUD 독점 Mac 노드가 Agent 호스트와 CI 빌드 플랫폼에 적합합니다.

데이터 기준: 2026-07-20. 출처: DeepSeek 공식 문서, arXiv:2606.19348, HuggingFace 모델 페이지, LLMReference, Artificial Analysis, MangoMind Blog.