Semana de superofertasClaude Skills — 20% DE DESCUENTO
News

DeepSeek V4.1-Flash: Novedades, precios y alternativas (2026)

Powerdrill Bloom·
DeepSeek V4.1-Flash: Novedades, precios y alternativas (2026)

DeepSeek lanzó V4.1-Flash el 10 de septiembre de 2026. Es un modelo Mixture-of-Experts de 552B parámetros que lee imágenes y texto de forma nativa, maneja un contexto de hasta un millón de tokens y se distribuye bajo una licencia MIT. El cambio principal es el costo: el modelo activa 8B parámetros en la entrada y 16B en la salida.

Esa última frase resume toda la historia de forma comprimida. Esta guía la analiza en detalle y presenta los precios publicados de la API. También explica qué cambia y qué no cambia con este lanzamiento si su trabajo final consiste en un informe, una presentación o una tabla.

Todos los datos que se presentan a continuación provienen de la propia nota de lanzamiento de DeepSeek, de su tarjeta de modelo en Hugging Face y de su página de precios publicada, verificados el 14 de septiembre de 2026.

Novedades en DeepSeek V4.1-Flash

La nota de lanzamiento de DeepSeek comienza con cuatro afirmaciones. El modelo es "más inteligente, más rápido y más eficiente". Es "el modelo más pequeño de nuestra nueva familia de arquitectura, con comprensión visual nativa". Está diseñado para ofrecer "una mayor capacidad, una inferencia más rápida y un mayor rendimiento". Y más adelante se escalará a modelos más grandes.

La tarjeta del modelo es más específica. DeepSeek-V4.1-Flash se describe como "un modelo multimodal Mixture-of-Experts (MoE) con 552B parámetros base y soporte para contextos de hasta un millón de tokens". Este "procesa de forma nativa imágenes y texto, y genera texto de manera autorregresiva".

Tres cambios son los que realmente importan para el trabajo diario, más allá de las pruebas de rendimiento.

La visión está integrada, no añadida como un parche. Un codificador de visión y un proyector de dos capas convierten las imágenes en embeddings. Estos se "procesan conjuntamente con los embeddings de texto desde el inicio del preentrenamiento del modelo de lenguaje". La tarjeta del modelo indica que DeepSeek-ViT, el codificador, se entrenó desde cero.

El contexto alcanza un millón de tokens. El preentrenamiento utilizó 45T tokens, con atención dispersa entrenada a 64K y el contexto ampliado a 1M más adelante en el proceso.

El esfuerzo de razonamiento es ajustable. El modelo "admite un ajuste de esfuerzo de razonamiento controlable de forma continua (un número entero del 1 al 100) que equilibra el costo de inferencia con la precisión". Solo gastará más en las preguntas que realmente lo requieran.

DeepSeek también retiró la generación anterior. La nota de lanzamiento indica que "V4-Flash & V4-Flash-Vision-Exp están retirados" y que los nombres de los modelos antiguos redirigen temporalmente a V4.1-Flash por motivos de compatibilidad.

El cambio de arquitectura detrás de la reducción de costos

Lo interesante del lanzamiento de DeepSeek V4.1-Flash no es la tabla de pruebas de rendimiento. Es la aritmética de la memoria.

DeepSeek-V4.1-Flash utiliza lo que la tarjeta del modelo denomina una arquitectura Causal Encoder-Decoder (CED). Se trata de un Transformer de 40 capas dividido en un codificador causal de 20 capas y un decodificador de 20 capas. La caché KV global del decodificador se proyecta a partir de los estados ocultos finales del codificador en lugar de construirse capa por capa.

El resultado práctico es la cifra que se cita en todas partes: 8B parámetros activos por token durante el prefill, 16B durante el decode. La tarjeta del modelo describe esto como una "mejora sustancial de la rentabilidad para cargas de trabajo de agentes con un uso intensivo de entradas".

"Uso intensivo de entradas" es la frase clave. Los documentos largos requieren un uso intensivo de entradas. También lo requiere un chat en el que se adjuntan cuarenta páginas y luego se hacen seis preguntas sobre ellas.

Otras dos técnicas reducen el tamaño de la propia caché. Compressed Sparse Attention 2 asigna a cada capa de atención uno de tres modos y comparte índices entre capas. El almacenamiento en caché KV principal FP4 guarda la caché en un formato de cuatro bits. En conjunto, la tarjeta del modelo sitúa la caché KV global en 890 bytes por token, aproximadamente una cuarta parte de la generación anterior.

La nota de lanzamiento traduce esto en la métrica que el comprador realmente percibe. En comparación con la generación anterior, la caché necesita "1/4 de HBM" y "1/8 de almacenamiento SSD". Añade que "los cargos por aciertos de caché (cache-hit) suelen representar una gran parte de los costos de los agentes".

Precios de DeepSeek V4.1-Flash

DeepSeek publica precios por millón de tokens y los divide en horas pico (peak) y horas valle (off-peak). Los valores a continuación corresponden a la página oficial de Models & Pricing del 14 de septiembre de 2026, en dólares estadounidenses.

Métrica Horas valle Horas pico
1M de tokens de entrada (acierto de caché) $0.003 $0.006
1M de tokens de entrada (fallo de caché) $0.15 $0.3
1M de tokens de salida $0.6 $1.2

La página indica que "las tarifas de horas valle son la mitad de las tarifas de horas pico" y define las horas pico como de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes. Todo lo demás se considera horas valle.

Junto a la tabla se detallan dos aspectos operativos. El nombre del modelo que se debe utilizar es deepseek-flash. La longitud del contexto es de 1M con una salida máxima de 384K, y el límite de concurrencia indicado es de 2,500.

En la misma página se señala que V4-Pro sigue estando disponible. DeepSeek escribe que ha "decidido continuar brindando servicios de API para DeepSeek V4 Pro después del 14 de septiembre de 2026". Se indica que el método de facturación se mantiene sin cambios.

Qué cubren las pruebas de rendimiento y qué no

Las tablas de modelos instruct de la tarjeta del modelo se inclinan hacia el código y el trabajo con agentes. Terminal-Bench, DeepSWE, NL2Repo-Bench y Codeforces ocupan la mayoría de las filas. Esto refleja hacia dónde apunta DeepSeek.

Cuatro filas son más relevantes si su resultado final es un documento.

Benchmark DeepSeek-V4.1-Flash-Base
DocVQA (LLM-Judge) 95.6
CVBench (EM) 77.9
RefCOCO-avg (Acc@0.5) 86.0
MMMU-Pro (EM) 56.5

DocVQA mide la respuesta a preguntas sobre imágenes de documentos. Esta es la aproximación publicada más cercana a la lectura de una factura escaneada, un contrato de arrendamiento o un informe en PDF. El modelo base obtiene una puntuación de 95.6 en esta prueba.

En cuanto a la versión instruct, Chartography con herramientas alcanza un 78.9 y BabyVision con herramientas un 89.6. Ambos son benchmarks de agentes visuales ejecutados a través de un entorno externo.

Considere estos datos como orientativos. La tarjeta del modelo indica que todas las evaluaciones de agentes utilizan temperature=1.0, top_p=0.95, y que los benchmarks de agentes visuales emplean una ventana de contexto de 512k tokens. Su configuración será diferente.

Qué cambia esto para el trabajo de documento a entregable

Un token de entrada más barato cambia por completo qué flujos de trabajo vale la pena automatizar.

Piense en un mes de facturas de proveedores en formato PDF. Con la aritmética anterior, realizaría la extracción una sola vez, guardaría un resumen y trabajaría a partir de él. La extracción era el paso costoso, por lo que se hacía con la menor frecuencia posible.

Las entradas tienen un precio de $0.15 por millón de tokens en caso de fallo de caché. Un acierto de caché cuesta una fracción de centavo. Con estas tarifas, volver a leer la fuente deja de ser el factor determinante del costo. Puede hacer una segunda pregunta sobre las páginas originales en lugar de recurrir a sus propias notas.

Esto es importante para la precisión, no solo para el presupuesto. Un resumen pierde el número de página. El original no.

El contexto de 1M tiene un efecto similar. Las órdenes de trabajo de un trimestre, un expediente de arrendamiento completo o un año de registros de turnos pueden caber en una sola ventana. Ya no tendrá que elegir qué diez documentos incluir.

La visión nativa cierra la última brecha. Un gráfico pegado en una diapositiva, la fotografía de la lectura de un medidor y un albarán de entrega escaneado se convierten en entradas legibles en lugar de algo que se debe volver a escribir.

Dónde deja de ayudar un modelo más barato

DeepSeek V4.1-Flash es una capa. El entregable es otra.

Las páginas de DeepSeek describen una API y un producto de chat. Detallan precios, límites de contexto, pruebas de rendimiento y el nombre de un modelo. Lo que no describen es un espacio de trabajo que mantenga unidos sus archivos, sus análisis previos y sus formatos de salida entre sesiones.

Esta es la división habitual del trabajo, no una deficiencia. Una API está pensada para ser un componente.

La consecuencia práctica es que el último tramo sigue siendo responsabilidad suya. Alguien todavía tiene que plasmar la respuesta en una tabla con formato, una diapositiva o un documento que un colega pueda abrir. Alguien todavía tiene que ser capaz de señalar una cifra y decir de qué página proviene.

Powerdrill Bloom se sitúa en esa capa. Su página de inicio lo describe como "el analista de datos de IA que muestra su trabajo". Añade que "cada número se presenta con la página, la fila y la cifra que lo respalda". Usted sube los archivos, pregunta en lenguaje natural y obtiene el resultado final.

Las dos capas se complementan en lugar de competir. Un modelo más barato, con mayor contexto y capacidad de visión abarata el paso de lectura. Un espacio de trabajo decide qué hacer con lo que se ha leído.

Alternativas que vale la pena conocer

Si está evaluando V4.1-Flash frente a otras opciones, estas son las tres comparaciones más habituales.

Frente a DeepSeek V4-Pro. La nota de lanzamiento señala que "pruebas realizadas por múltiples partes sitúan a V4.1-Flash por delante de V4-Pro en rendimiento, costo, velocidad y tiempo total de ejecución". Añade que DeepSeek está "retirando gradualmente V4-Pro". La página de precios todavía muestra a V4-Pro a $0.66 por millón de tokens de entrada en caso de fallo de caché en horas valle, frente a los $0.15 de Flash. V4-Pro no incluye soporte de visión en esa página.

Frente a modelos cerrados de frontera. La tabla comparativa de la tarjeta del modelo incluye a Opus-5.0 y GPT-5.6 Sol. Flash lidera en varias filas de tareas de agentes, incluyendo Terminal-Bench 2.1 con un 90.6 y AutomationBench con un 54.8. Se queda atrás en Terminal-Bench 3.0 y 4.0. Tome las tablas publicadas por los proveedores con la debida cautela.

Frente a un espacio de trabajo en lugar de un modelo. Si lo que realmente necesita es un informe terminado a partir de archivos que ya tiene, la comparación no debe hacerse de modelo a modelo. Nuestra recopilación de alternativas a DeepSeek aborda este enfoque, y la explicación sobre agentes de datos de IA define la categoría.

Cómo acceder a DeepSeek V4.1-Flash

En las propias páginas de DeepSeek se documentan tres vías de acceso.

La API es la primera. Dirija su cliente a https://api.deepseek.com para el formato compatible con OpenAI, o a https://api.deepseek.com/anthropic para el formato de Anthropic, y configure el modelo como deepseek-flash. La página de precios indica que se admiten la salida JSON, las llamadas a herramientas, la API de Responses y la visión.

El producto de chat es la segunda, en chat.deepseek.com, al cual la tarjeta del modelo enlaza directamente.

Los pesos son la tercera. El modelo está publicado en Hugging Face bajo una licencia MIT, acompañado de un informe técnico. Esta es la vía adecuada si necesita implementarlo dentro de su propia red.

Una nota para la tercera vía. La tarjeta del modelo indica que "este lanzamiento no incluye una plantilla de chat en formato Jinja", por lo que la codificación de los prompts requerirá atención si realiza un autohospedaje.

FAQs

¿Qué es DeepSeek V4.1-Flash? Es un modelo multimodal Mixture-of-Experts lanzado por DeepSeek el 10 de septiembre de 2026. La tarjeta del modelo detalla 552B parámetros base, procesamiento nativo de imágenes y texto, y soporte para contextos de hasta un millón de tokens. Está publicado bajo una licencia MIT.

¿Cuánto cuesta DeepSeek V4.1-Flash? La página oficial de precios indica $0.15 por millón de tokens de entrada en caso de fallo de caché en tarifas de horas valle, y $0.3 en horas pico. La salida cuesta $0.6 en horas valle y $1.2 en horas pico. La entrada con acierto de caché cuesta $0.003 en horas valle.

¿Admite imágenes DeepSeek V4.1-Flash? Sí. La tarjeta del modelo describe un codificador de visión entrenado desde cero, con embeddings visuales procesados conjuntamente con el texto desde el inicio del preentrenamiento. La página de precios señala que la visión está admitida para deepseek-flash.

¿Qué pasó con DeepSeek V4-Flash? La nota de lanzamiento indica que V4-Flash y V4-Flash-Vision-Exp están retirados. Los nombres de los modelos heredados todavía se aceptan y redirigen a V4.1-Flash, facturándose al precio de Flash.

¿Es DeepSeek V4.1-Flash adecuado para crear informes y diapositivas? El modelo se encarga del paso de lectura, y su puntuación de 95.6 en DocVQA sugiere una sólida comprensión de documentos. Convertir eso en un entregable con formato corresponde a una capa independiente, que es precisamente lo que ofrece un espacio de trabajo de IA.

Conclusión

DeepSeek V4.1-Flash es un lanzamiento centrado en la eficiencia disfrazado de un lanzamiento de capacidades. El trabajo de arquitectura se centró en la caché KV, y el beneficio se nota en las entradas largas.

Para cualquiera cuyos datos lleguen en forma de documentos, este es el camino más útil. Volver a leer cien páginas dos veces es ahora un error de redondeo en lugar de una decisión difícil.

El modelo sigue entregándole texto. Si su semana laboral termina con una tabla que alguien debe aprobar, el paso posterior al modelo es el que realmente le consume tiempo. Pruebe Powerdrill Bloom gratis y suba los documentos que pensaba resumir a mano.


Fuentes (al 14-09-2026): Nota de lanzamiento de DeepSeek-V4.1-Flash · Tarjeta del modelo DeepSeek-V4.1-Flash · Modelos y precios de DeepSeek. Los precios y la disponibilidad cambian; consulte las páginas oficiales antes de presupuestar.