Saltar al contenido
arbelxez

14 min de lectura

Qwen3.8-27B

Alibaba27BPesos abiertos · 14 de agosto de 2026

Veintisiete mil setecientos ochenta y un millones de parámetros, licencia Apache 2.0, lectura de imágenes y vídeo y 262.144 tokens de contexto. La pregunta útil no es si alcanza a los modelos cerrados —eso depende de con cuál se compare y de qué semana—, sino cuál era la última razón para no tener el modelo en casa y si esa razón sigue en pie. Aquí van separados lo que midió Qwen, lo que midió alguien ajeno y lo que no ha medido nadie.

La tesis

El 14 de agosto de 2026 Alibaba publicó bajo Apache 2.0 un modelo denso de 27B que puntúa 52 en el índice de Artificial Analysis: trece puntos por encima del buque insignia cerrado de la generación anterior y seis por debajo del que su propia casa llevaba once días vendiendo.

Ficha técnica

Publicación

14 de agosto de 2026. La model card solo fecha el mes; el día sale del historial de commits del repositorio, con el LICENSE añadido a las 04:15 UTC.

Cifra del fabricanteHugging Face · Qwen/Qwen3.8-27B · commits

Licencia

Apache 2.0. Sin cláusula de usuarios activos, sin umbral de ingresos y sin reparto: el fichero del repositorio es el texto íntegro de la Apache de 2004.

Cifra del fabricanteQwen/Qwen3.8-27B · LICENSE

Parámetros

27.781.427.952 en BF16. La card los redondea a «27B» y no reconcilia las dos cifras. Es denso, así que están activos todos en cada token.

Cifra del fabricanteHugging Face · Qwen/Qwen3.8-27B · safetensors

Arquitectura

Causal Language Model con codificador de visión. 64 capas, dimensión oculta 5120 y el bloque híbrido 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)).

Cifra del fabricanteQwen/Qwen3.8-27B · model card

Codificador de visión

La card no publica ni su tamaño ni su arquitectura. Ollama pesa el proyector aparte —461 M de parámetros, 931 MB— y ahí está la diferencia entre las dos cifras de parámetros que circulan. Qwen no confirma el desglose.

Sin verificarOllama · qwen3.8:27b

Modalidades

Entrada de texto, imagen y vídeo. Salida, solo texto.

Cifra del fabricanteQwen/Qwen3.8-27B · model card

Ventana de contexto

262.144 tokens nativos y hasta 1.000.000 con YaRN estático, del que la propia card avisa que puede degradar los textos cortos. El millón por defecto pertenece a Qwen Cloud, un servicio de pago que a esta fecha seguía sin abrir.

Cifra del fabricanteQwen/Qwen3.8-27B · model card

Contexto sin tocar nada

LM Studio arranca en 8.192 tokens y el modelo se los gasta pensando. Hay que subirlo a mano hasta los 262.144 para que deje de chocar contra el techo.

Verificación independienteSimon Willison · Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things

Razonamiento por defecto

reasoning_effort en xhigh. Los otros dos valores son medium y low, y el modo thinking se puede desactivar por petición.

Cifra del fabricanteQwen/Qwen3.8-27B · model card

Peso en disco

17,77 GB en Q4_K_M, 29,12 GB en Q8_0 y 54,66 GB en BF16. El repositorio de cuantizaciones incluye capas MTP y proyector de visión.

Verificación independientebartowski/Qwen3.8-27B-GGUF

Memoria en ejecución

18 GB de VRAM a 4k de contexto, 22 GB a 64k y 34 GB a los 262.144 nativos, con un quant de 16,68 GiB y la visión desactivada. El despliegue ocupa el doble que el fichero.

Verificación independienteHardware Corner · We Tested Qwen3.8 27B

Velocidad medida

40,31 tok/s en una RTX 3090 y 74,83 en una RTX 5090, las dos a 4k de contexto y con descarga completa a GPU. La misma 5090 cae a 22,79 tok/s a 128k.

Verificación independienteHardware Corner · We Tested Qwen3.8 27B

Corte de conocimiento

No lo declara. Ni la model card ni ninguna otra fuente primaria dan fecha de corte de los datos de entrenamiento. Poner una aquí sería inventarla.

Sin verificarQwen/Qwen3.8-27B · model card

A quién le cambia algo

  • Programador

    Bájalo, ponle reasoning_effort en medium antes del primer prompt y mide el tiempo hasta la respuesta, no los tokens por segundo.

    Cambia mucho

  • Analista de datos

    Pásale tus propias tablas y gráficas antes de creerte el 83,7 de CharXiv: nadie ajeno a Qwen ha medido todavía la visión de este modelo.

    Cambia poco

  • Funcionario público

    Pide 32 GB de VRAM en el presupuesto antes de prometer nada: el fichero pesa 18 GB, pero a contexto completo el despliegue ocupa 34.

    Cambia poco

  • Periodista

    Escribe el nivel de esfuerzo al lado de cada cifra: el mismo modelo puntúa 52, 44 y 43 según cómo se arranque.

    Cambia poco

  • Profesor

    Pruébalo en la máquina que ya tienes antes de pedir otra: por debajo de 32 GB de memoria unificada no llega al contexto que anuncia.

    Cambia poco

  • Abogado

    Nada que hacer

    No cambia nada

  • Diseñador

    Nada que hacer

    No cambia nada

  • Dueño de una tienda pequeña

    Nada que hacer

    No cambia nada

01

El cambio no es el que se cuenta

El relato del lanzamiento es que un modelo abierto alcanzó a los cerrados. Ese relato lleva un año siendo verdad a plazos: la calidad de lo que se puede ejecutar en una máquina propia viene subiendo despacio y sin titulares desde antes de este modelo. Una pendiente no es una noticia. Lo que sí pasó el 14 de agosto es otra cosa, y es más interesante: se agotaron a la vez las demás razones para preferir la nube.

Queda una razón en pie, y es la rara del grupo: la velocidad. Las otras tres eran propiedades del modelo, y por eso las arregla un lanzamiento. La velocidad es una propiedad del ancho de banda de memoria de la máquina que hay debajo, y esa no la mueve ningún checkpoint. Son dos curvas distintas: una avanza cada pocos meses en un repositorio y la otra avanza cuando alguien compra otro ordenador.

Las cifras

El índice general de Artificial Analysis. La gráfica toma el líder del benchmark y los tres vecinos inmediatos por arriba y por abajo, así que se ve a quién le gana además de a quién pierde. El nombre completo de cada uno está en la tabla de debajo.

  • 63

  • 58

  • 56

  • 53

  • 52

  • 44

  • 39

  • OPUS 5

  • 3.8 MAX

  • GEMINI 3.7

  • DEEPSEEK V4

  • 3.8-27B · xhigh

  • 3.8-27B · medium

  • 3.7-PLUS

  1. Claude Opus 5 (max)63
  2. Qwen3.8 Max58
  3. Gemini 3.7 Flash (high)56
  4. DeepSeek V4 Pro53
  5. Qwen3.8-27B · xhigh52
  6. Qwen3.8-27B · medium44
  7. Qwen3.7-Plus39

Es la comparación más limpia de la ficha: todas las cifras salen del mismo método y del mismo sitio. Once puntos hasta la frontera por arriba. Y trece por encima del insignia cerrado que esta misma casa vendía en mayo, que entra fijado a mano porque su papel no es la distancia sino el salto.

Pesos abiertos

Verificación independienteArtificial Analysis · Intelligence Index

02

La velocidad no se mide en tokens por segundo

Artificial Analysis mide 53,84 tok/s y etiqueta el resultado como notablemente lento frente a una mediana de clase de unos 105 —y lo mide contra la API alojada del propio Alibaba, no contra una ejecución local. Hardware Corner mide 74,83 tok/s en una RTX 5090 de consumo a 4k de contexto. Una tarjeta de videojuegos le gana a la nube del fabricante: con eso basta para enterrar la idea de que lo local es, por definición, lo lento.

Y la tasa, la que sí es tasa, es un problema de hardware. El modelo es denso: para cada token hay que leer los 27,78 mil millones de parámetros enteros. De ahí salen los 40,31 tok/s de una RTX 3090, los 74,83 de una 5090 y los 22,79 de esa misma 5090 cuando el contexto sube a 128k. La decodificación especulativa con MTP añade entre un 33 % y un 181 % según la tarjeta, que es otra manera de decir que ninguno de esos números es una propiedad del modelo.

Lo que dice el anuncio

  1. Plausible

    «Context Length: 262,144 natively and extensible up to 1,000,000 tokens.»

    Cierto en el config.json y falso al arrancar. LM Studio abre en 8.192 tokens, Ollama obliga a fijar la variable a mano, el millón se consigue con YaRN estático —que la propia card avisa que puede degradar los textos cortos— y el millón por defecto pertenece a Qwen Cloud, que a esta fecha seguía en «coming soon». De las tres cifras que circulan, la que se obtiene sin pagar ni configurar es la más baja.

    Cifra del fabricanteQwen/Qwen3.8-27B · model card

  2. Marketing

    «Matching the performance of Qwen3.7-plus — an MoE model ten times its size.»

    La frase no está en la documentación técnica: está en la nota de prensa. Y el tamaño de Qwen3.7-Plus nunca se publicó —Artificial Analysis anota que Alibaba no ha revelado su número de parámetros—, así que el «diez veces» compara contra una cifra que no existe en ningún sitio. En la tabla del propio fabricante, además, el 27B pierde contra ese mismo Qwen3.7-Plus en HLE, GPQA Diamond, OmniDocBench 1.5, RealWorldQA y ERQA.

    Cifra del fabricanteAlibaba Cloud · Alibaba Unveils Qwen3.8-27B

  3. Plausible

    «Problematic tasks were corrected, and all baseline models were re-evaluated on the refined benchmark.»

    Es la nota al pie de SWE-bench Pro y hay que leerla dos veces: Qwen corrigió el benchmark y volvió a medir a sus competidores sobre la versión corregida por Qwen. Lo mismo hizo con las anotaciones de referencia de MathVision y CharXiv. Declararlo es más honesto que callarlo, y aun así deja las veinticuatro filas sin una sola verificación externa. No hay informe técnico: arXiv no devuelve ni una entrada para Qwen3.8.

    Cifra del fabricanteQwen/Qwen3.8-27B · model card

  4. Marketing

    «xhigh (default): for complex tasks demanding thorough analysis.»

    El ajuste que viene de fábrica es el más caro que existe, y esta ficha lo mide más abajo. Un valor por defecto no es una especificación: es una apuesta del fabricante sobre qué quiere el usuario medio, y esta es la primera que conviene deshacer. Quien se lo descargue y no la toque no va a medir el modelo, va a medir la apuesta.

    Cifra del fabricanteQwen/Qwen3.8-27B · model card

  5. Plausible

    «A native vision-language model that understands images and videos.»

    Verificado como declaración, no como comportamiento. Ninguna de las mediciones ajenas de esta ficha toca imagen ni vídeo: Hardware Corner desactivó la visión en sus pruebas y Willison y Tunguz solo ejercitaron texto. Y en local la visión no viene incluida: hay que cargar el proyector aparte, 931 MB que no están en el fichero de 17 GB del que habla todo el mundo.

    Cifra del fabricanteQwen/Qwen3.8-27B · model card

  6. Comprobado

    «license: apache-2.0»

    Es la única afirmación del lanzamiento que se comprueba en diez segundos y sin benchmark: el LICENSE del repositorio es el texto íntegro de la Apache 2.0 y ModelScope registra la misma licencia en el segundo canal oficial. También es la que de verdad cambia algo —sin cláusula de usuarios, sin umbral de ingresos, sin reparto— y es la que no aparece en ningún titular.

    Cifra del fabricanteQwen/Qwen3.8-27B · LICENSE

03

Quien no toque los valores por defecto va a concluir que la IA local es mala

El GGUF conserva el xhigh de fábrica, y eso tiene consecuencias visibles. Simon Willison le pidió un SVG de un pelícano en bicicleta: veintiún minutos y 22.276 tokens de razonamiento para producir 3.223 de salida. El mismo encargo con el razonamiento desactivado: 137 segundos. Su recomendación es literal y no admite lectura amable: ignora ese valor por defecto y arranca en low o sin razonamiento.

El segundo valor por defecto agrava el primero. LM Studio abre en 8.192 tokens de contexto y el modelo se los come pensando en cualquier trivialidad; Ollama necesita que alguien fije OLLAMA_CONTEXT_LENGTH a mano. Son dos ajustes de dos programas distintos que, combinados con el dial del fabricante, convierten un modelo bueno en una demostración mala. Quien lo descargue esta tarde y no cambie nada no va a medir el modelo: va a medir tres valores por defecto.

El precio de pensar más

El mismo modelo, dos alturas del dial de razonamiento
Dial en xhigh, el que viene de fábrica
52Intelligence Index
160 millones de tokens de salida para correr el índice entero.
Dial en medium, el que conviene
44Intelligence Index
75 millones de tokens de salida para correr el mismo índice.

Ocho puntos de índice cuestan más del doble de tokens. El ajuste que viene de fábrica es el más caro que existe, y es el que va a medir cualquiera que se lo descargue esta tarde y no toque nada.

Verificación independienteArtificial Analysis · Intelligence Index

04

De dónde sale el 52 y qué no significa

Tampoco se midió sobre los pesos que uno se descarga. La ficha declara que la fuente de rendimiento es la API alojada de Alibaba y no publica en qué precisión corrió, existiendo repositorios en BF16 y en FP8. Nadie ha publicado un índice del fichero de 4 bits. El objeto que puntúa 52 y el objeto que cabe en el disco de casa no se ha demostrado que sean el mismo, y esa distinción no es un tecnicismo: es justo la que sostiene el titular.

Las comparaciones piden su propia nota al pie. El 52 contra el 47 de Qwen3.7-Max es una victoria sobre un buque insignia ya jubilado; contra Qwen3.8-Max —el modelo cerrado que Alibaba llevaba once días vendiendo cuando salió el 27B— es 52 contra 58. En votación humana a ciegas el hueco con ese insignia ronda los 58 puntos de Elo. Y empatar con GPT-5.6 Luna es empatar con el escalón barato de OpenAI, un dólar por millón de entrada, no con el que venden para los problemas difíciles.

Benchmark por benchmark

Terminal-Bench 2.1 · trabajo de agente en una terminal

  • 88,2

  • 82,9

  • 82,7*

  • 75,1

  • 73

  • 67,8

  • 65,1

  • 57

  • GLM-5.3

  • MUSE SPARK

  • DS V4 FLASH

  • DOTS3

  • 3.8-27B

  • ORNITH 35B

  • POKEE 28B

  • LING 3.0

  1. GLM-5.3 (max)88,2
  2. Muse Spark 1.282,9
  3. DeepSeek V4 Flash 073182,7*
  4. dots3-note Preview75,1
  5. Qwen3.8-27B73
  6. Ornith-1.5-35B-A3B67,8
  7. Pokee-Isaac 28B65,1
  8. Ling 3.0 Flash57

* Cifra del propio fabricante, medida con otro andamiaje que el resto del campo.

Aquí el campo se abre de verdad, del 88 al 46, y el 27B cae en mitad de la tabla. Esa posición es la que hace útil una comparación: contra los de arriba pierde, contra los de abajo gana, y las dos cosas se leen a la vez. Las filas de DeepSeek van marcadas porque su propia casa las publica con otro andamiaje, según avisa el leaderboard.

Pesos abiertos

Verificación independienteTerminal-Bench 2.1 · leaderboard

GPQA Diamond · preguntas de ciencia de posgrado

  • 95,5

  • 92,9

  • 92,4

  • 89,9

  • 88,9

  • 88,1

  • 78,5

  • 68,4

  • 47

  • GEMINI 3.1

  • KIMI K3

  • DEEPSEEK V4

  • DS V4 FLASH

  • 3.8-27B

  • GLM-5.3

  • GPT-OSS

  • MISTRAL L

  • LLAMA 4

  1. Gemini 3.1 Pro Preview95,5
  2. Kimi K392,9
  3. DeepSeek V4 Pro92,4
  4. DeepSeek V4 Flash 073189,9
  5. Qwen3.8-27B88,9
  6. GLM-5.3 (max)88,1
  7. gpt-oss-120b (high)78,5
  8. Mistral Large 251268,4
  9. Llama 4 Scout47

La forma de esta gráfica ES el argumento, y hay que leerla contra la de arriba. En preguntas de examen el campo está apretadísimo y en trabajo de terminal va del 46 al 88. Saber no es lo mismo que hacer, y lo segundo es lo que se paga. Llama 4 Scout entra fijado, lejos de todos, porque sin el suelo del catálogo abierto un campo de vecinos deja creer que todo lo abierto anda por el noventa. Y aquí la cifra del 27B la mide un tercero, así que por una vez no lleva asterisco.

Pesos abiertos

Verificación independienteVals AI · GPQA Diamond (espejo de BenchLM, 19 ago 2026)

05

Lo que cuesta tenerlo en casa

«Cabe en 17 GB» describe un fichero en reposo, no un despliegue. Ollama descarga 18 GB más 931 MB de proyector de visión, y la memoria en uso crece con la ventana: 18 GB a 4k, 22 a 64k, 26 a 128k y 34 GB a los 262.144 nativos, con la visión apagada. Este modelo en particular no se puede correr a contexto corto, porque el contexto corto se lo gasta pensando. La configuración que produce la calidad pide el doble de memoria que el titular.

Dicho todo eso: 2.358.347 descargas del repositorio oficial a nueve días del lanzamiento, y el mirror en GGUF de Unsloth cuenta 6.674.515 por su cuenta. Con todas las advertencias puestas, mucha gente ya tiene el fichero. Esa es la parte de la historia que no necesita un benchmark para ser cierta.

El veredicto

Qwen3.8-27B no demuestra que lo abierto haya alcanzado a lo cerrado: demuestra que la última razón para preferir la nube ya no es un modelo, es una tarjeta gráfica.