한 줄 결론: 7월 31일 deepseek-v4-flash 정식판은 신규 모델이 아니라 동일 284B/13B MoE의 후훈련 재실행입니다. API 요금은 입력 $0.14(캐시 미스)/$0.0028(히트), 출력 $0.28/M, MIT 라이선스. 본 글은 V4 GA 총정리를 전제로 타임라인·Harness·Kimi K3/GLM-5.2/Qwen3.8-Max 비교·벤치마크 논쟁·킬 라인(斩杀線)·6단계 Runbook·FAQ를 다룹니다. 로컬 평가는 ds4 Mac 추론 가이드를 함께 참고하세요.
00V4-Flash-0731에서 실제로 바뀐 것
DeepSeek-V4-Flash-0731은 2026년 7월 31일 API 공개 베타에서 정식 빌드로 올라온 284B 총 파라미터·13B 활성 MoE 모델입니다. 4월 24일 프리뷰와 파라미터 규모·네트워크 구조가 완전히 동일하며, DeepSeek 공식은 성능 향상이 「후훈련 재실행」에만 기인한다고 명시했습니다. 100만 토큰 컨텍스트, MIT 오픈웨이트, Hugging Face 동시 공개는 유지됩니다.
이번 업데이트는 API 전용입니다. 소비자용 앱과 웹 채팅은 구 빌드 그대로입니다. V4-Pro 정식판과 Harness는 changelog상 「곧 공개」이며 확정 일정은 없습니다.
| 항목 | V4-Flash-0731(정식) | V4-Pro(프리뷰만) |
|---|---|---|
| 총 / 활성 파라미터 | 284B / 13B | 1.6T / 49B |
| 컨텍스트 | 1M tokens | 1M tokens |
| 입력(미스 / 히트) | $0.14 / $0.0028 per M | $0.435 / $0.003625 per M |
| 출력 | $0.28 per M | $0.87 per M |
| 라이선스 | MIT | MIT |
| 상태(8/5 기준) | API 정식판 | 프리뷰 지속, 정식 미발표 |
痛点정식판 라벨 뒤에 숨은 제약
- 신규 모델이 아님: 파라미터를 늘리지 않았으므로 세계 지식 상한은 구조적으로 동일합니다. Agent·코드 벤치 상승은 후훈련과 평가 조건에 의존합니다.
- Harness 미공개: Terminal Bench 2.0 등 눈에 띄는 점수는 미배포 Harness minimal mode 측정. Claude Code·Cursor로의 일반화는 미검증입니다.
- 캐시 히트율 이슈: 해외 개발자 커뮤니티에서 입력 캐시 적중률 저하, 안전 분류기 타임아웃 등이 보고되어 연산·운영 병목이 남아 있습니다.
- API만 갱신: 앱 미동기화로 사내 평가(API)와 제품 경험(App)이 어긋나는 기간이 이어집니다.
- 피크 요금 불확실: DeepSeek는 베이징 시간 피크 2배 할증을 예고했으나 8월 5일 기준 시행일 미확정입니다.
- 여름 경쟁 밀집: 7/24 API 마이그레이션, 7/27 Kimi K3 웨이트, 7/31 Flash 정식, 8/3 Qwen3.8-Max GA가 겹쳐 라우팅 미갱신 팀은 비용·품질 불일치를 겪습니다.
01타임라인: 4월 프리뷰에서 7월 정식판까지
| 일자 | 이벤트 |
|---|---|
| 2026-04-24 | V4 프리뷰+MIT 오픈소스. V4-Pro(1.6T/49B)·V4-Flash(284B/13B), 100만 토큰 |
| 2026-07-24 | deepseek-chat / deepseek-reasoner 영구 중단, V4 명명 체계로 전환 |
| 2026-07-27 | Kimi K3(2.8T) Hugging Face 전면 공개 |
| 2026-07-31 | V4-Flash-0731 API 정식판, 웨이트 동기화, Harness 최초 언급(미공개) |
| 2026-08-02~03 | Qwen3.8-Max GA(API $2/$6, 웨이트는 차주 예정) |
| 2026-08-05 | V4-Pro 정식·Harness 공개일 미확정(8/10~20 GA 등은 미확인 루머) |
02후훈련과 아키텍처: CSA+HCA, mHC, Muon
0731 빌드는 구조를 바꾸지 않았지만, V4 패밀리 기술 기반은 이해할 가치가 있습니다. 기술 보고서 『DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence』의 핵심은 다음과 같습니다.
- 하이브리드 어텐션(CSA + HCA): 압축 희소·고압축 어텐션 결합. 100만 토큰에서 V3.2 대비 추론 FLOPs 27%, KV Cache 10%(Flash 7%)라고 공식 발표.
- mHC(다양체 제약 초연결): 61층 심층 네트워크에서 신호가 안정 전파되도록 잔차 구조 개선.
- Muon 옵티마이저: 수렴 속도와 학습 안정성 향상.
0731의 시사점은 「더 크다≠더 강하다」입니다. 284B/13B가 1.6T/49B V4-Pro 프리뷰를 여러 Agent 벤치에서 넘긴 것은 2026년 하반기 경쟁이 후훈련 품질로 이동하고 있음을 보여 줍니다.
03DeepSeek Harness: 최초 자체 Agent 프레임워크
7월 31일 changelog에서 처음 이름이 붙은 DeepSeek Harness는 파일 I/O·도구 호출·다단계 엔지니어링 작업용 자체 Agent 실행 기반으로, Claude Code에 대응합니다. 지금까지 DeepSeek는 Claude Code·OpenCode 등 제3자 Harness에 의존해 왔습니다.
공개된 Agent 벤치(Terminal Bench 2.0, Toolathlon 등)는 모두 Harness minimal mode(미공개)에서 max 추론, top_p=0.95, temperature=1.0 조건으로 측정되었습니다. DeepSeek도 「벤치마크는 harness 선택에 극도로 민감」하다고 경고했으므로, 수치를 모델 단독 능력과 동일시하면 안 됩니다.
| 벤치마크(벤더 자체 보고) | V4-Flash-0731 | V4-Pro 프리뷰 |
|---|---|---|
| Terminal Bench 2.0 | 82.7 | 67.9 |
| 측정 조건 | Harness minimal mode(미공개), max / top_p=0.95 / temp=1.0 | |
04횡단 비교: Kimi K3·GLM-5.2·Qwen3.8-Max·클로즈드 플래그십
| 모델 | 총 파라미터 | Intelligence Index | 작업당 비용 | API 입/출($/M) | 웨이트 |
|---|---|---|---|---|---|
| V4-Flash-0731 | 284B | 50 | $0.03 | $0.14 / $0.28 | MIT 공개 |
| Kimi K3 | 2.8T | 57 | $0.86 | $3 / $15 | 7/27 공개 |
| GLM-5.2(智谱) | ~744B | V4-Flash 대비 +1점대 | 본문 미확인 | 본문 미확인 | MIT(6월) |
| Qwen3.8-Max | 2.4T / 95B 활성 | 본문 미확인 | 본문 미확인 | $2 / $6 | 차주 예정 |
| GPT-5.6 Sol | 비공개 | +9점 이상 | $1.86 | 클로즈드 | — |
| Claude Opus 4.8 / Fable 5 | 비공개 | +9점 이상 | ~$3.15 | 고가 | — |
Intelligence Index와 작업당 비용은 제3자 기관 Artificial Analysis 데이터(财经媒体 인용)입니다. DeepSeek 자체 Agent 벤치와 방법론이 달라 직접 합산 비교할 수 없습니다. Index에서는 K3·GLM-5.2가 Flash보다 높아도 작업당 비용은 K3의 약 1/29, GPT-5.6 Sol의 약 1/62, Claude Fable 5의 약 1/105 수준입니다. DeepSeek는 「벤치 1위」가 아니라 「충분한 지능+극한 가격」으로 OpenRouter 7주 연속 1위 전략을 이어갑니다.
Claude Opus 4.8 대비 가격(21세기경제보道 등): 캐시 미스 입력 약 36배, 캐시 히트 입력 약 179배, 출력 약 89배 저렴하다고 보도됩니다. 벤더 리스트 가격 기준입니다.
05논쟁점: 벤치마크 해석과 미확인 정보
- Harness 의존 자체 벤치: Terminal Bench 2.0 82.7은 미공개 프레임워크 의존. 독립 재현(Claude Code, Cursor 등) 대기.
- 실사용 격차: 캐시 적중률 저하, 안전 분류기 타임아웃 등 벤치 내러티브와 운영 체감의 괴리.
- V4-Pro / Harness 일정: 「8월 10~20 GA」 등은 익명 출처 루머. 공식은 「가능한 한 빨리」뿐.
- 투자·IPO 보도: 약 74억 달러 조달, 487억 달러 밸류에이션 등은财经媒体 「据报道」 수준. 규제 서류·공식 성명 없음.
06킬 라인(斩杀線)과 가격전쟁 다음 국면
중국 AI 커뮤니티에서는 V4-Pro 중순 GA 지연 때 창업자 梁文锋를 「梁白开(공약 공백)」으로 놀리다가, 0731 정식판 상회 후 「梁圣(성군)」으로 되돌리는 감정 반전이 화제였습니다. 더 실무적인 개념이 「斩杀線(킬 라인)」입니다.
킬 라인은 DeepSeek의 「충분한 성능+극저가」 조합이 시장에 깔아 둔 생존 임계값을 뜻합니다. DeepSeek를 분명히 능가하지 못하면서 가격도 못 깎는 경쟁사는 존재감을 잃을 수 있다는 프레임으로, 동기간 GPT-5.6 Luna 80% 인하 등 각사의 밀집 가격 조정을 설명합니다.
7월 31일 당일 Nvidia·Broadcom·AMD 등 연산칩 주가에 큰 변동은 없었습니다. 2025년 초 DeepSeek-R1 충격과 대조적으로, 시장은 「적은 연산으로 동등 효과」를 이례가 아닌 엔지니어링 진보로 받아들이기 시작했습니다.
076단계 Runbook: V4-Flash-0731 프로덕션 연결
from openai import OpenAI
client = OpenAI(
api_key="your_deepseek_api_key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "이 PR diff를 요약하고 테스트 관점을 나열해 줘"}],
extra_body={"thinking": {"type": "enabled"}}
)
print(response.choices[0].message.content)
-
01
구 모델명 잔존 감사:
deepseek-chat/deepseek-reasoner를 코드베이스 전체 검색. 7월 24일 이후에도 남아 있으면 즉시 수정합니다. -
02
deepseek-v4-flash가 0731을 가리키는지 확인: 동일 model명 자동 전환으로 Staging에서 출력 품질·지연 베이스라인을 기록합니다. -
03
사고 모드·라우팅 설계: 경량 작업은 Non-think, Agent/코드는 Think High. 복잡 추론만 V4-Pro 프리뷰로 에스컬레이션합니다.
-
04
Prompt Cache·토큰 모니터링: 입력 $0.14 vs $0.0028 격차가 큽니다. 캐시 적중률, P95 지연, 작업 성공률을 대시보드화합니다.
-
05
자체 Harness A/B: Terminal Bench 자체 수치를 맹신하지 말고, 프로덕션 저장소 20~50건으로 K3·Qwen3.8-Max·현행 모델과 병행 비교합니다.
- 06
08정리와 FAQ
V4-Flash-0731은 「신 플래그십」이 아니라 동일 284B의 후훈련 갱신과 API 정식화입니다. Agent 벤치는 인상적이나 Harness 의존, 제3자 Index에서는 K3/GLM-5.2에 지수 점수로 뒤처지지만 작업당 비용은 압도적입니다. 프로덕션 채택 전 자체 작업 검증이 필수입니다.
V4-Flash로 대규모 Agent 파이프라인을 돌리는 팀에게 API 단가 $0.14/$0.28 절감이 대역폭 지터·이웃 CPU 경합·장시간 SSH 끊김에 상쇄되지 않는 환경이 필요합니다. 공유 VPS·과잉 구독 macOS에서는 월 청구는 내려도 작업 성공률이 떨어질 수 있습니다. 더 안정적인 프로덕션 Agent 호스트로 NUKCLOUD 다지역 베어메탈 Mac / 클라우드 Mac 노드가 전용 Apple Silicon과 명확한 테넌트 경계를 제공합니다. 가격 페이지에서 사양을 확인하고 주문 페이지에서 시험 노드를 확보하세요.
-
V4-Flash-0731은 새 모델인가요?아닙니다. 284B/13B 구조는 4월 프리뷰와 동일하며 후훈련만 갱신되었습니다.
-
Flash와 Pro 프리뷰 중 무엇을 선택하나요?대량·저비용 Agent, 배치는 Flash 정식판. 깊은 세계 지식·복잡 추론에 예산이 있으면 Pro 프리뷰를 임시 사용하고 정식 GA 후 재평가하세요.
-
Harness를 지금 쓸 수 있나요?changelog에 이름만 공개. 일반 사용자 배포는 미확인. Claude Code 등 기존 Harness로 평가를 진행하세요.
-
공식 벤치마크를 믿어도 되나요?SWE-bench Verified 등은 비교적 신뢰. Terminal Bench 2.0 등은 미공개 Harness 의존—DeepSeek도 harness 민감성을 경고했습니다.
-
V4-Pro 정식판은 언제인가요?확정일 없음. 8/10~20 GA 등은 미확인 루머. 공식 changelog만 근거로 삼으세요.
-
로컬 추론이 가능한가요?MIT 웨이트는 Hugging Face에 공개되어 있습니다. 고메모리 Apple Silicon 절차는 ds4 Runbook을 참고하세요.
데이터 기준: 2026-08-05. 출처: DeepSeek API 문서·changelog, 기술 보고서, Hugging Face, Artificial Analysis(财经媒体 인용), 21세기경제보道, Moonshot/智谱/阿里 공식 정보.