AgDex
Breaking Deep Dive April 25, 2026 · 8 min read

DeepSeek V4 Released: 1.6T Parameters, 1M Context Window, Open-Source SOTA (2026)

DeepSeek just dropped V4 — and it's a major step. 1.6 trillion total parameters, 49B active via MoE, native 1M context window, and open-weights. For AI agent builders, this changes the cost equation significantly.

What Is DeepSeek V4?

Released April 24, 2026, DeepSeek V4 comes in two variants: V4-Pro and V4-Flash . Both are open-weights, available on Hugging Face, and accessible via the DeepSeek API today.

This is not an incremental update — DeepSeek V4 introduces a new attention mechanism (DSA), a completely redesigned MoE architecture, and deliberate optimizations for agentic workloads. The official tech report calls it "open-source SOTA in Agentic Coding benchmarks."

V4-Pro vs V4-Flash: Spec Comparison

Spec V4-Pro V4-Flash
Total Parameters 1.6T 284B
Active Parameters (MoE) 49B 13B
Context Window 1M tokens 1M tokens
Thinking Mode
Agentic Coding Open-source SOTA Near V4-Pro on simple tasks
World Knowledge Leads open models (2nd only to Gemini-3.1-Pro) Strong
Best For Complex reasoning, agents, coding Speed, cost, simple agents

Architecture Innovations

1. DeepSeek Sparse Attention (DSA)

DSA combines token-wise compression with a novel sparse attention pattern. The result: 1M context is achievable with "drastically reduced compute and memory costs" — the official claim. In practice this means agentic workloads with large codebases, long documents, or multi-turn agent histories fit in a single context without chunking.

2. MoE with 49B Active Parameters

V4-Pro has 1.6T total parameters but only routes through 49B per token inference. This is the same Mixture-of-Experts approach that made DeepSeek V3 so cost-efficient. The ratio here (~3% active) is aggressive — similar to what Mixtral and earlier DeepSeek models used, but at a much larger base model scale.

3. Dual Mode: Thinking vs Non-Thinking

Like DeepSeek-R1 introduced, V4 supports both standard (non-thinking) and extended reasoning (thinking) modes via a single API endpoint. You can switch per-request — useful for building agents that do fast retrieval in non-thinking mode and complex planning in thinking mode.

Why This Matters for AI Agent Builders

1M Context Changes Agent Memory Architecture

Most production agent systems use RAG or external memory (Mem0, Zep) specifically because LLM context windows were too small to hold full conversation history and tool outputs. With 1M tokens natively, you can fit approximately 750,000 words — roughly the full text of the Lord of the Rings trilogy — in a single context.

For agents running long tasks (24h+ coding sessions, multi-step research), this removes a significant architectural complexity. Whether the cost of 1M context is still worth it vs. a good retrieval system is task-dependent — but the option now exists.

Open-Source SOTA in Agentic Coding

DeepSeek claims V4-Pro is open-source SOTA on agentic coding benchmarks. Notably, it's already integrated with Claude Code and OpenCode — meaning you can point these harnesses at DeepSeek V4 via its OpenAI-compatible API. For teams spending heavily on Claude API costs for coding agents, this is worth benchmarking immediately.

The price differential between DeepSeek and Anthropic/OpenAI remains substantial — typically 5-10x cheaper per token for comparable capability. If V4-Pro delivers on agentic coding claims, migration cost drops sharply.

Cost: The Real Story

DeepSeek has historically priced below OpenAI by 80-90%. V4 pricing isn't officially published at time of writing, but given their track record and the MoE architecture, it'll likely undercut GPT-4o and Claude Sonnet significantly. For agent workloads that run thousands of API calls per day, this is not a minor detail.

API Migration Guide

If you're currently using deepseek-chat or deepseek-reasoner , here's what you need to know:

  • deepseek-chat now routes to deepseek-v4-flash (non-thinking mode)
  • deepseek-reasoner now routes to deepseek-v4-flash (thinking mode)
  • Both legacy model names will be retired July 24, 2026
  • Explicit model name: just change model="deepseek-v4-pro" or model="deepseek-v4-flash"
  • Base URL and API key unchanged
  • Supports both OpenAI ChatCompletions API and Anthropic API format
# Before
client.chat.completions.create(model="deepseek-chat", ...)
# After (explicit V4-Pro)
client.chat.completions.create(model="deepseek-v4-pro", ...)

DeepSeek V4 vs GPT-4o vs Claude Sonnet

Based on the official tech report claims and available benchmark data:

Dimension DeepSeek V4-Pro GPT-4o Claude 3.7 Sonnet
Context Window 1M 128K 200K
Open Weights
Agentic Coding Open-source SOTA Strong Strong
Relative Cost Lowest Medium Medium
Thinking Mode Via o3
Self-Host ✅ (open weights)

Caveats and What to Watch

  • Benchmark claims vs. real tasks: "Open-source SOTA in Agentic Coding" needs independent verification on your specific workloads. SWE-bench and similar benchmarks have known limitations.
  • Self-hosting 1.6T models: The open weights are available, but running V4-Pro locally requires significant GPU infrastructure. Most teams will use the API.
  • DSA efficiency: The 1M context cost claims need real-world API pricing to evaluate. At current token prices, 1M context fills still cost money.
  • Rate limits on launch day: APIs often throttle on release. Test before committing production traffic.

Quick Start with DeepSeek V4 for Agents

The API is OpenAI-compatible, so migration from any existing setup is straightforward:

# LangChain example
from langchain_openai import ChatOpenAI

llm = ChatOpenAI(
model="deepseek-v4-pro",
base_url="https://api.deepseek.com",
api_key="your-deepseek-api-key",
max_tokens=8192
)

# CrewAI example
from crewai import LLM

llm = LLM(
model="deepseek/deepseek-v4-pro",
api_key="your-deepseek-api-key"
)

Bottom Line

DeepSeek V4 is a serious release. The combination of 1M context, open weights, MoE efficiency, and agentic coding SOTA claim puts it firmly in the conversation for production AI agent infrastructure in 2026.

For teams currently paying Anthropic or OpenAI rates for heavy agent workloads — especially coding agents — V4-Pro is worth a benchmark immediately. The API migration is a one-line change.

For teams that need enterprise SLAs, Western data residency, or deep ecosystem integrations, the established providers remain safer bets. But cost and context window? DeepSeek V4 wins on both.

AdSense bottom

Explore 400+ AI agent tools, LLM APIs, frameworks, and observability tools at AgDex.ai — the curated directory for AI builders in 2026.

Última hora Análisis Profundo 25 de abril de 2026 · Lectura de 8 min

Lanzamiento de DeepSeek V4: 1.6T de parámetros, ventana de contexto de 1M, SOTA de código abierto (2026)

DeepSeek acaba de lanzar V4, y es un paso importante. 1.6 billones de parámetros totales, 49 mil millones activos a través de MoE, ventana de contexto nativa de 1M y pesos abiertos. Para los desarrolladores de agentes de IA, esto cambia significativamente la ecuación de costos.

¿Qué es DeepSeek V4?

Lanzado el 24 de abril de 2026, DeepSeek V4 viene en dos variantes: V4-Pro y V4-Flash . Ambos son de pesos abiertos, están disponibles en Hugging Face y ya se puede acceder a ellos a través de la API de DeepSeek hoy mismo.

Esta no es una actualización incremental: DeepSeek V4 introduce un nuevo mecanismo de atención (DSA), una arquitectura MoE completamente rediseñada y optimizaciones deliberadas para cargas de trabajo agenticas. El informe técnico oficial lo llama "SOTA de código abierto en benchmarks de codificación agentica".

V4-Pro vs V4-Flash: Comparación de especificaciones

Especificación V4-Pro V4-Flash
Parámetros totales 1.6T 284B
Parámetros activos (MoE) 49B 13B
Ventana de contexto 1M tokens 1M tokens
Modo de pensamiento
Codificación agentica SOTA de código abierto Cerca de V4-Pro en tareas simples
Conocimiento del mundo Lidera los modelos abiertos (solo superado por Gemini-3.1-Pro) Sólido
Ideal para Razonamiento complejo, agentes, codificación Velocidad, costo, agentes simples

Innovaciones de arquitectura

1. DeepSeek Sparse Attention (DSA)

DSA combina la compresión por token con un novedoso patrón de atención dispersa. El resultado: una ventana de contexto de 1M es alcanzable con "costos de memoria y cómputo drásticamente reducidos", según la afirmación oficial. En la práctica, esto significa que las cargas de trabajo de agentes con grandes bases de código, documentos largos o historiales de agentes de múltiples turnos caben en un solo contexto sin necesidad de fragmentación.

2. MoE con 49B de parámetros activos

V4-Pro tiene 1.6T de parámetros totales, pero solo enruta a través de 49B por inferencia de token. Este es el mismo enfoque de Mezcla de expertos (MoE) que hizo que DeepSeek V3 fuera tan rentable. La proporción aquí (~3% activo) es agresiva, similar a la utilizada por Mixtral y modelos anteriores de DeepSeek, pero a una escala de modelo base mucho mayor.

3. Modo dual: con pensamiento vs sin pensamiento

Al igual que se introdujo en DeepSeek-R1, V4 admite tanto el modo estándar (sin pensamiento) como el de razonamiento extendido (con pensamiento) a través de un único endpoint de API. Puede cambiar por solicitud, lo que resulta útil para crear agentes que realicen búsquedas rápidas en modo sin pensamiento y planificación compleja en modo con pensamiento.

Por qué esto es importante para los creadores de agentes de IA

La ventana de contexto de 1M cambia la arquitectura de memoria del agente

La mayoría de los sistemas de agentes en producción utilizan RAG o memoria externa (Mem0, Zep) específicamente porque las ventanas de contexto de los LLM eran demasiado pequeñas para contener todo el historial de conversaciones y las salidas de las herramientas. Con 1M de tokens de forma nativa, puede albergar aproximadamente 750,000 palabras (más o menos el texto completo de la trilogía de El Señor de los Anillos) en un solo contexto.

Para los agentes que ejecutan tareas largas (sesiones de codificación de más de 24 horas, investigación de múltiples pasos), esto elimina una complejidad arquitectónica significativa. Si el costo del contexto de 1M sigue valiendo la pena frente a un buen sistema de recuperación depende de la tarea, pero la opción ahora existe.

SOTA de código abierto en codificación agentica

DeepSeek afirma que V4-Pro es el SOTA de código abierto en benchmarks de codificación agentica. Cabe destacar que ya está integrado con Claude Code y OpenCode, lo que significa que puede apuntar estas herramientas a DeepSeek V4 a través de su API compatible con OpenAI. Para los equipos que gastan mucho en costos de la API de Claude para agentes de codificación, vale la pena realizar un benchmark de inmediato.

La diferencia de precio entre DeepSeek y Anthropic/OpenAI sigue siendo sustancial: suele ser entre 5 y 10 veces más barato por token para una capacidad comparable. Si V4-Pro cumple con las afirmaciones de codificación agentica, el costo de migración disminuye drásticamente.

Costo: la historia real

Históricamente, DeepSeek ha fijado precios entre un 80% y un 90% inferiores a los de OpenAI. El precio de V4 no está publicado oficialmente al momento de escribir este artículo, pero dada su trayectoria y la arquitectura MoE, es probable que sea significativamente inferior al de GPT-4o y Claude Sonnet. Para flujos de trabajo de agentes que ejecutan miles de llamadas a la API por día, este no es un detalle menor.

Guía de migración de API

Si actualmente utiliza deepseek-chat o deepseek-reasoner , esto es lo que necesita saber:

  • deepseek-chat ahora enruta a deepseek-v4-flash (modo sin pensamiento)
  • deepseek-reasoner ahora enruta a deepseek-v4-flash (modo con pensamiento)
  • Ambos nombres de modelos heredados serán retirados el 24 de julio de 2026
  • Nombre de modelo explícito: simplemente cambie a model="deepseek-v4-pro" o model="deepseek-v4-flash"
  • Base URL y clave API sin cambios
  • Admite tanto la API ChatCompletions de OpenAI como el formato de la API de Anthropic
# Antes
client.chat.completions.create(model="deepseek-chat", ...)
# Después (V4-Pro explícito)
client.chat.completions.create(model="deepseek-v4-pro", ...)

DeepSeek V4 vs GPT-4o vs Claude Sonnet

Basado en las afirmaciones del informe técnico oficial y los datos de benchmarks disponibles:

Dimensión DeepSeek V4-Pro GPT-4o Claude 3.7 Sonnet
Ventana de contexto 1M 128K 200K
Pesos abiertos
Codificación agentica SOTA de código abierto Sólido Sólido
Costo relativo El más bajo Medio Medio
Modo de pensamiento Vía o3
Autohospedaje ✅ (pesos abiertos)

Advertencias y aspectos a vigilar

  • Afirmaciones de benchmarks frente a tareas reales: El "SOTA de código abierto en codificación agentica" necesita una verificación independiente en sus cargas de trabajo específicas. SWE-bench y benchmarks similares tienen limitaciones conocidas.
  • Autohospedaje de modelos de 1.6T: Los pesos abiertos están disponibles, pero ejecutar V4-Pro localmente requiere una infraestructura de GPU significativa. La mayoría de los equipos utilizarán la API.
  • Eficiencia de DSA: Las afirmaciones sobre el costo del contexto de 1M necesitan precios de API del mundo real para ser evaluadas. Con los precios de tokens actuales, llenar un contexto de 1M todavía cuesta dinero.
  • Límites de velocidad el día del lanzamiento: Las API a menudo limitan el tráfico en su lanzamiento. Realice pruebas antes de comprometer tráfico de producción.

Inicio rápido con DeepSeek V4 para agentes

La API es OpenAI-compatible, por lo que la migración desde cualquier configuración existente es sencilla:

# Ejemplo de LangChain
from langchain_openai import ChatOpenAI

llm = ChatOpenAI(
model="deepseek-v4-pro",
base_url="https://api.deepseek.com",
api_key="tu-clave-api-de-deepseek",
max_tokens=8192
)

# Ejemplo de CrewAI
from crewai import LLM

llm = LLM(
model="deepseek/deepseek-v4-pro",
api_key="tu-clave-api-de-deepseek"
)

En resumen

DeepSeek V4 es un lanzamiento serio. La combinación de la ventana de contexto de 1M, los pesos abiertos, la eficiencia de MoE y la afirmación de SOTA en codificación agentica lo sitúan firmemente en la conversación para la infraestructura de agentes de IA en producción en 2026.

Para los equipos que actualmente pagan las tarifas de Anthropic o OpenAI por cargas de trabajo pesadas de agentes (especialmente agentes de codificación), vale la pena evaluar V4-Pro de inmediato. La migración de la API es un cambio de una sola línea.

Para los equipos que necesitan SLA empresariales, residencia de datos occidentales o integraciones profundas en el ecosistema, los proveedores establecidos siguen siendo opciones más seguras. Pero ¿costo y ventana de contexto? DeepSeek V4 gana en ambos.

AdSense bottom

Explore más de 400 herramientas de agentes de IA, API de LLM, frameworks y herramientas de observabilidad en AgDex.ai — el directorio seleccionado para creadores de IA en 2026.

Eilmeldung Tiefes Eintauchen 25. April 2026 · 8 Min. Lesedauer

DeepSeek V4 veröffentlicht: 1,6T Parameter, 1M Kontextfenster, Open-Source-SOTA (2026)

DeepSeek hat soeben V4 veröffentlicht – und das ist ein großer Schritt. 1,6 Billionen Gesamtparameter, 49 Mrd. aktiv über MoE, ein natives 1M-Kontextfenster und offene Gewichte. Für Entwickler von KI-Agenten ändert dies die Kostenkalkulation erheblich.

Was ist DeepSeek V4?

DeepSeek V4 wurde am 24. April 2026 veröffentlicht und ist in zwei Varianten erhältlich: V4-Pro und V4-Flash . Beide sind quelloffen (Open-Weights), auf Hugging Face verfügbar und ab heute über die DeepSeek-API zugänglich.

Dies ist kein schrittweises Update – DeepSeek V4 führt einen neuen Aufmerksamkeitsmechanismus (DSA), eine komplett überarbeitete MoE-Architektur und gezielte Optimierungen für Agenten-Workloads ein. Der offizielle technische Bericht nennt es „Open-Source-SOTA bei Agentic Coding-Benchmarks“.

V4-Pro vs. V4-Flash: Spezifikationsvergleich

Spezifikation V4-Pro V4-Flash
Gesamtparameter 1,6T 284B
Aktive Parameter (MoE) 49B 13B
Kontextfenster 1M Token 1M Token
Denkmodus
Agentisches Codieren Open-Source-SOTA Nahe an V4-Pro bei einfachen Aufgaben
Weltwissen Führt offene Modelle an (nur hinter Gemini-3.1-Pro) Stark
Bestens geeignet für Komplexes Denken, Agenten, Codierung Geschwindigkeit, Kosten, einfache Agenten

Architekturinnovationen

1. DeepSeek Sparse Attention (DSA)

DSA kombiniert Token-weise Komprimierung mit einem neuartigen Sparse-Attention-Muster. Das Ergebnis: Ein 1M-Kontext ist mit „drastisch reduzierten Rechen- und Speicherkosten“ erreichbar – so die offizielle Behauptung. In der Praxis bedeutet dies, dass Agenten-Workloads mit großen Codebasen, langen Dokumenten oder mehrteiligen Agentenverläufen ohne Chunking in einen einzigen Kontext passen.

2. MoE mit 49 Mrd. aktiven Parametern

V4-Pro verfügt über insgesamt 1,6T Parameter, leitet aber bei der Inferenz pro Token nur über 49 Mrd. weiter. Dies ist derselbe Mixture-of-Experts-Ansatz, der DeepSeek V3 so kosteneffizient gemacht hat. Das Verhältnis hier (~3 % aktiv) ist aggressiv – ähnlich wie bei Mixtral und früheren DeepSeek-Modellen, jedoch auf einer viel größeren Basismodell-Skala.

3. Dualer Modus: Denken vs. Nicht-Denken

Wie bei DeepSeek-R1 eingeführt, unterstützt V4 sowohl den Standardmodus (Nicht-Denken) als auch den erweiterten Logikmodus (Denken) über einen einzigen API-Endpunkt. Sie können pro Anfrage wechseln – nützlich für den Aufbau von Agenten, die im Nicht-Denkmodus schnelle Suchen durchführen und im Denkmodus komplexe Planungen vornehmen.

Warum dies für Entwickler von KI-Agenten wichtig ist

1M-Kontext verändert die Speicherarchitektur von Agenten

Die meisten produktiven Agentensysteme nutzen RAG oder externen Speicher (Mem0, Zep) gerade deshalb, weil die Kontextfenster von LLMs zu klein waren, um den gesamten Gesprächsverlauf und die Tool-Ausgaben aufzunehmen. Mit nativen 1M Token können Sie etwa 750.000 Wörter – ungefähr den gesamten Text der „Herr der Ringe“-Trilogie – in einen einzigen Kontext packen.

Für Agenten, die lange Aufgaben ausführen (Codierungssitzungen über mehr als 24 Stunden, mehrstufige Recherchen), entfällt dadurch eine erhebliche architektonische Komplexität. Ob sich die Kosten für ein 1M-Kontextfenster im Vergleich zu einem guten Retrieval-System lohnen, hängt von der Aufgabe ab – aber die Option besteht nun.

Open-Source-SOTA bei Agentic Coding

DeepSeek behauptet, dass V4-Pro Open-Source-SOTA bei Agenten-Codierungs-Benchmarks ist. Insbesondere ist es bereits in Claude Code und OpenCode integriert – was bedeutet, dass Sie diese Testumgebungen über die OpenAI-kompatible API auf DeepSeek V4 ausrichten können. Für Teams, die hohe Claude-API-Kosten für Codierungs-Agenten zahlen, lohnt sich ein sofortiger Benchmark.

Der Preisunterschied zwischen DeepSeek und Anthropic/OpenAI bleibt beträchtlich – in der Regel 5- bis 10-mal günstiger pro Token bei vergleichbarer Leistung. Wenn V4-Pro die Versprechungen beim agentischen Codieren einhält, sinken die Migrationskosten drastisch Sieg.

Kosten: Die wahre Geschichte

DeepSeek lag preislich in der Vergangenheit 80–90 % unter OpenAI. Die Preise für V4 sind zum Zeitpunkt des Schreibens noch nicht offiziell veröffentlicht. Angesichts der bisherigen Praxis und der MoE-Architektur werden sie GPT-4o und Claude Sonnet jedoch wahrscheinlich deutlich unterbieten. Für Agenten-Workloads, die täglich Tausende von API-Aufrufen ausführen, ist dies kein unwichtiges Detail.

API-Migrationshandbuch

Wenn Sie derzeit deepseek-chat oder deepseek-reasoner verwenden, sollten Sie Folgendes wissen:

  • deepseek-chat leitet jetzt zu deepseek-v4-flash weiter (Nicht-Denkmodus)
  • deepseek-reasoner leitet jetzt zu deepseek-v4-flash weiter (Denkmodus)
  • Beide alten Modellnamen werden am 24. Juli 2026 eingestellt
  • Expliziter Modellname: Ändern Sie einfach zu model="deepseek-v4-pro" oder model="deepseek-v4-flash"
  • Basis-URL und API-Schlüssel unverändert
  • Unterstützt sowohl die OpenAI ChatCompletions API als auch das Anthropic API-Format
# Vorher
client.chat.completions.create(model="deepseek-chat", ...)
# Nachher (explizit V4-Pro)
client.chat.completions.create(model="deepseek-v4-pro", ...)

DeepSeek V4 vs GPT-4o vs Claude Sonnet

Angesichts der Behauptungen im offiziellen technischen Bericht und der verfügbaren Benchmark-Daten:

Dimension DeepSeek V4-Pro GPT-4o Claude 3.7 Sonnet
Kontextfenster 1M 128K 200K
Offene Gewichte
Agentisches Codieren Open-Source-SOTA Stark Stark
Costo relativo Niedrigste Mittel Mittel
Denkmodus Über o3
Self-Hosting ✅ (offene Gewichte)

Warnhinweise und worauf zu achten ist

  • Benchmark-Behauptungen vs. reale Aufgaben: „Open-Source-SOTA bei Agentic Coding“ erfordert eine unabhängige Überprüfung für Ihre spezifischen Workloads. SWE-bench und ähnliche Benchmarks weisen bekannte Einschränkungen auf.
  • Self-Hosting von 1,6T-Modellen: Die offenen Gewichte sind verfügbar, aber die lokale Ausführung von V4-Pro erfordert eine erhebliche GPU-Infrastruktur. Die meisten teams werden die API nutzen.
  • DSA-Effizienz: Die Behauptungen über die Kosten eines 1M-Kontextfensters müssen anhand realer API-Preise bewertet werden. Bei den aktuellen Token-Preisen kostet das Füllen eines 1M-Kontexts immer noch Geld.
  • Rate Limits am Einführungstag: APIs drosseln oft bei Veröffentlichung. Testen Sie, bevor Sie Produktiv-Traffic darauf leiten.

Schnellstart mit DeepSeek V4 für Agenten

Die API ist OpenAI-kompatibel, sodass die Migration von jedem bestehenden Setup unkompliziert ist:

# LangChain-Beispiel
from langchain_openai import ChatOpenAI

llm = ChatOpenAI(
model="deepseek-v4-pro",
base_url="https://api.deepseek.com",
api_key="ihr-deepseek-api-schluessel",
max_tokens=8192
)

# CrewAI-Beispiel
from crewai import LLM

llm = LLM(
model="deepseek/deepseek-v4-pro",
api_key="ihr-deepseek-api-schluessel"
)

Fazit

DeepSeek V4 ist ein beachtliches Release. Die Kombination aus 1M-Kontext, offenen Gewichten, MoE-Effizienz und dem Anspruch auf die SOTA beim agentischen Codieren rückt das Modell für die KI-Agenteninfrastruktur im Jahr 2026 in den Fokus.

Für Teams, die derzeit Anthropic- oder OpenAI-Preise für rechenintensive Agenten-Workloads zahlen – insbesondere Codierungs-Agenten –, lohnt sich ein sofortiger Benchmark von V4-Pro. Die API-Migration erfordert nur die Änderung einer Zeile.

Für Teams, die Unternehmens-SLAs, westliche Datenspeicherung oder tiefe Integrationen in Ökosysteme benötigen, bleiben die etablierten Anbieter die sicherere Wahl. Aber Kosten und Kontextfenster? Hier gewinnt DeepSeek V4 an beiden Fronten.

AdSense bottom

Entdecken Sie über 400 KI-Agenten-Tools, LLM-APIs, Frameworks und Observability-Tools auf AgDex.ai — dem kuratierten Verzeichnis für KI-Entwickler im Jahr 2026.

速報 ディープダイブ 2026年4月25日 · 所要時間 8 分

DeepSeek V4リリース:1.6兆パラメータ、100万トークンの文脈窓、オープンソースで最高の性能(2026年)

DeepSeekが最新モデル「V4」をリリースしました。総パラメータ数1.6兆、MoEによるアクティブパラメータ数490億、ネイティブで100万トークンのコンテキストウィンドウ、そしてオープンウェイト(モデル重みの公開)。AIエージェント開発者にとって、コスト構造を劇的に塗り替える重大な一歩となります。

DeepSeek V4とは?

2026年4月24日にリリースされたDeepSeek V4には、 V4-Pro V4-Flash の2つのバリアントがあります。どちらもオープンウェイトとしてHugging Faceで公開されており、本日からDeepSeekのAPI経由でも利用可能です。

今回のリリースは単なるマイナーアップデートではありません。DeepSeek V4は、新しいアテンション機構(DSA)、完全に再設計されたMoEアーキテクチャ、そしてエージェントワークロード向けの最適化を導入しています。公式の技術レポートでは「エージェント型コーディングのベンチマークにおいてオープンソースのSOTA(最高性能)」と謳われています。

V4-ProとV4-Flashのスペック比較

スペック V4-Pro V4-Flash
総パラメータ数 1.6兆 284B
アクティブパラメータ数(MoE) 490億 13B
コンテキストウィンドウ 100万トークン 100万トークン
思考モード
エージェント型コーディング オープンソースSOTA シンプルなタスクではV4-Proと同等
一般知識 オープンモデルの中で首位(Gemini-3.1-Proに次ぐ2位) 優秀
最適なユースケース 複雑な推論、エージェント、コーディング 速度、低コスト、シンプルなエージェント

アーキテクチャの革新

1. DeepSeek Sparse Attention(DSA)

DSAは、トークン単位の圧縮技術と新しいスパースアテンションパターンを組み合わせています。その結果、「計算コストとメモリコストを劇的に削減」しつつ、100万トークンのコンテキストウィンドウを実現しました。実務においては、大規模なコードベース、長大なドキュメント、または何往復ものエージェント履歴を伴うエージェントワークロードを、チャンク分割することなく単一のコンテキスト内に収めることができます。

2. 490億アクティブパラメータのMoE

V4-Proの総パラメータ数は1.6兆ですが、トークン推論ごとにルーティングされるのは490億パラメータのみです。これは、DeepSeek V3の優れたコスト効率を支えたMixture-of-Experts(MoE)アプローチと同じです。アクティブパラメータの比率(約3%)は極めて絞り込まれており、Mixtral y 従来のDeepSeekモデルと同様ですが、ベースモデルの規模ははるかに大きくなっています。

3. デュアルモード:思考(Thinking)と通常(Non-Thinking)

DeepSeek-R1で導入されたアプローチと同様に、V4は単一のAPIエンドポイントで標準(非思考)モードと拡張推論(思考)モードの両方をサポートしています。リクエストごとに切り替えが可能なため、通常モードで高速な検索を行い、思考モードで複雑なプランニングを実行するようなエージェントの構築に最適です。

AIエージェント開発者にとって重要な理由

100万トークン対応がもたらすエージェントメモリ設計の変革

これまで、本番運用のエージェントシステムの多くは、会話履歴やツールの出力をすべてコンテキスト内に保持するにはLLMのコンテキストウィンドウが小さすぎたため、RAGや外部メモリ(Mem0、Zepなど)を導入していました。100万トークンをネイティブに扱えるようになれば、約75万語(『指輪物語』3部作の全文に相当)を単一のコンテキストに収めることができます。

24時間以上の連続コーディングセッションや複数ステップにわたる調査など、長時間のタスクを実行するエージェントにおいて、メモリシステム構築の複雑さが大幅に軽減されます。100万トークンの入力を丸ごと読み込ませるコストが、優れた検索システムを利用する場合と比較して見合うかどうかはタスクによりますが、開発者の選択肢として強力なカードが加わりました。

エージェントコーディング分野のオープンソース最高峰

DeepSeekは、V4-Proがエージェント型コーディングベンチマークにおいてオープンソースのSOTAであると主張しています。特に、すでにClaude CodeやOpenCodeと統合されているため、これらのハーネスの接続先をOpenAI互換API経由でDeepSeek V4に向けることができます。コーディングエージェントの運用でClaudeのAPIコストが膨らんでいる開発チームは、すぐに検証を開始する価値があります。

DeepSeekとAnthropicやOpenAIとの価格差は依然として大きく、同等の処理能力でありながらトークンあたりのコストは通常5〜10倍安価です。V4-Proがその性能要件を満たしている場合、移行によるコスト削減効果は非常に大きくなります。

コストプランの真実

DeepSeekは歴史的にOpenAIより80〜90%安価な価格設定を行ってきました。執筆時点でV4の正確な価格は公式発表されていませんが、これまでの実績やMoEアーキテクチャを踏まえると、GPT-4oやClaude Sonnetを大幅に下回ることは確実です。1日に数千回のAPIコールを実行するエージェントのワークロードにとって、これは決して小さな差ではありません。

API移行ガイド

現在 deepseek-chat または deepseek-reasoner をお使いの場合は、以下の点にご留意ください。

  • deepseek-chat は今後、自動的に deepseek-v4-flash (非思考モード)へルーティングされます
  • deepseek-reasoner は今後、自動的に deepseek-v4-flash (思考モード)へルーティングされます
  • 両方の旧モデル名は 2026年7月24日に廃止 されます
  • モデル名の明示指定: model="deepseek-v4-pro" または model="deepseek-v4-flash" に変更するだけです
  • ベースURLおよびAPIキーは変更ありません
  • OpenAIのChatCompletions APIとAnthropicのAPIフォーマットの両方に対応
# 移行前
client.chat.completions.create(model="deepseek-chat", ...)
# 移行後(V4-Proを明示指定)
client.chat.completions.create(model="deepseek-v4-pro", ...)

DeepSeek V4 vs GPT-4o vs Claude Sonnet

公式技術レポートの主張および公開されているベンチマークデータに基づきます:

比較項目 DeepSeek V4-Pro GPT-4o Claude 3.7 Sonnet
コンテキストウィンドウ 100万 128K 200K
オープンウェイト
エージェント型コーディング オープンソースSOTA 優秀 優秀
相対コスト 最安 中程度 中程度
思考モード o3経由
セルフホスト ✅(オープンウェイト)

注意すべきポイントと懸念事項

  • ベンチマークと実際のタスクのギャップ: 「コーディング分野のオープンソース最高峰」という評価については、開発チーム独自のワークロードで個別検証する必要があります。SWE-bench等のベンチマークには既知の限界があります。
  • 1.6兆モデルのセルフホスト: オープンウェイトとして公開されていますが、V4-Proをローカルで動かすには膨大なGPUインフラが必要です。ほとんどの開発チームはAPIの利用を選択することになります。
  • DSAの効率性: 100万トークンのコンテキスト処理コストについては、実際のAPI利用料をもとに試算する必要があります。現在のトークン価格であっても、100万トークンを埋める処理には一定の費用がかかります。
  • リリース初日のレート制限: リリース直後はAPIが制限されやすくなります。本番環境に適用する前に十分テストを行ってください。

エージェント開発向けクイックスタート

APIはOpenAI互換であるため、既存の構成からの移行は極めて容易です:

# LangChainの例
from langchain_openai import ChatOpenAI

llm = ChatOpenAI(
model="deepseek-v4-pro",
base_url="https://api.deepseek.com",
api_key="あなたのDeepSeekのAPIキー",
max_tokens=8192
)

# CrewAIの例
from crewai import LLM

llm = LLM(
model="deepseek/deepseek-v4-pro",
api_key="あなたのDeepSeekのAPIキー"
)

まとめ

DeepSeek V4は極めて本格的なリリースです。100万トークンの文脈、重みの公開、MoEの効率性、そしてエージェント型コーディング最高峰の実力により、2026年における実用レベルのAIエージェントインフラとして有力な選択肢となるでしょう。

現在AnthropicやOpenAIのAPIを利用し、特にコーディングエージェントなどで膨大なワークロードを抱えている開発チームは、すぐにベンチマークを実行する価値があります。APIの移行作業はコードを1行変更するだけです。

エンタープライズ向けのSLA、欧米内でのデータ保管制限、あるいは特定エコシステムとの密接な連携が必要なチームにとっては、既存の主要プロバイダーの方が依然として無難な選択です。しかし、コスト効率とコンテキストの長さを最優先する場合、DeepSeek V4が両面で勝利を収めています。

AdSense bottom

400種類以上のAIエージェントツール、LLM API、フレームワーク、オブザーバビリティ(観測性)ツールについては、 AgDex.ai — (2026年時点の開発者向け厳選ディレクトリ)でご確認ください。