Qwen3.8-27B · agosto 2026
Para un heavy user, alquilar la GPU gana
El 27B es un modelo denso, con visión, 262k de contexto y licencia Apache 2.0. En API todavía está caro para lo que es. En una 4090 de $0,34/h, el thinking deja de facturarte.
4090 Community, apagada al acabar. A 2–4 h/día son 15–40 $. A 8–12 h, 60–120 $.
Qwen 27B en Chutes. Grok/Claude API se va a $300–3.000. Los planes de $20–200 se quedan cortos y te cortan.
Para ti: no subas a SuperGrok Heavy ($300) ni a Cursor Ultra ($200) solo por tokens. Monta el 27B en una GPU barata y deja SuperGrok ($30) o Claude Pro ($20) para el 10 % de tareas que el 27B no cierra.
Qué es, sin el blog post
Qwen3.8-27B salió el 14 de agosto. Es el hermano pequeño del Qwen3.8-Max (2,4T MoE). Denso, multimodal (texto + imagen + vídeo), thinking por defecto, reasoning_effort (xhigh / medium / low) y preserve_thinking.
Unsloth lo hace caber en 17–19 GB a 4-bit. BF16 pide ~56 GB. Contexto nativo 262k, estirable a 1M con YaRN. En una 4090 con Q4 y 32–64k de contexto va fino; 128k aprieta. A40/A6000 48 GB o 5090 32 GB van más holgadas.
Qwen publica SWE-bench Pro 61,7 frente a 53,4 de Opus 4.6 Max (ellos reevaluaron el resto). Terminal Bench 2.1: 73,0 vs 78,2 de Opus. LiveCodeBench v6: 90,3. Tómalo como tecla de techo, no como verdad de laboratorio, pero el modelo no es un juguete local: la gente lo está usando para coding agent de verdad, ~65 tok/s en 4090 con MTP.
Licencia Apache 2.0. Lo hosteas, lo finetuneas, lo vendes. Qwen Cloud oficial del 27B: “coming soon”. Hoy se come por pesos o por terceros.
APIs, hoy
OpenRouter lista tres proveedores del 27B. El más barato es Chutes. El listado medio del modelo está un poco por encima.
| Ruta | In / 1M | Out / 1M | Cache |
|---|---|---|---|
| Qwen3.8-27B · Chutes | $0,40 | $3,00 | $0,04 |
| Qwen3.8-27B · io.net | $0,44 | $3,15 | $0,25 |
| Qwen3.8-27B · AkashML | $0,45 | $3,20 | $0,05 |
| Qwen3.6-27B (más viejo) | $0,29 | $2,40 | — |
| Qwen3.8-Max / 2.4T | $2,00 | $6,00 | $0,25 |
| Grok 4.6 | $2,00 | $6,00 | $0,50 |
| Claude Sonnet 5 | $2,00 | $10,00 | $0,20 |
| Claude Opus 5 / 4.8 | $5,00 | $25,00 | $0,50 |
| OrcaRouter 27B “free” | $0 | $0 | 429 |
OpenRouter API, 17 ago 2026. Cache = lectura de input cacheado. OrcaRouter es rate-limit, no sirve para un heavy user. El endpoint oficial de Qwen Cloud para el 27B aún no está. El 3.6-27B ya bajó de precio: el 3.8-27B probablemente también en 2–4 semanas, cuando haya más replicas.
El output a $3 es el problema. El modelo piensa en xhigh por defecto. Ese razonamiento se cobra como completion. En un agente, una tanda fácil se va a 8–15k tokens de thinking + 2k de respuesta. En GPU eso es tiempo. En API es dinero.
Los planes tipo Grok / Claude / Cursor
Te venden “ilimitado”. Te cortan por ventana de 5 horas y por tope semanal. Si ya se te quedan cortos, el siguiente escalón es caro y sigue teniendo techo. Luego te empujan a créditos API.
| Plan | $/mes | Qué te dan de verdad |
|---|---|---|
| Claude Pro | 20 | Claude Code incluido. Se acaba en un día pesado. |
| Claude Max 5× | 100 | 5× Pro por ventana de 5 h + tope semanal. |
| Claude Max 20× | ~200 | El 20× no sale en la tarjeta; la FAQ habla de 5× o 20×. Sigue habiendo techo. |
| SuperGrok | 30 | Grok 4.6 + Grok Build. El plan razonable de backup. |
| SuperGrok Plus | 100 | Más uso, más rápido. Sigue siendo cuota, no tokens sueltos. |
| SuperGrok Heavy | 300 | Página de Grok Bot. Máximo de Grok. Mal negocio solo por tokens. |
| Cursor Pro | 20 | ~$20 de crédito frontier. Composer va aparte, más generoso. |
| Cursor Pro+ | 60 | ~3×, ~$70 de crédito. |
| Cursor Ultra | 200 | ~20×, ~$400 de crédito. Luego overage a precio API. |
| ChatGPT Pro | 200 | Codex alto. Sigue sin ser “usa lo que quieras” en agentes largos. |
Traducción: un plan de $200 te compra como mucho unos cientos de dólares de modelo frontier, y encima te lo racionan. Un heavy user de agentes (contexto de repo + tools + thinking) se come eso en días. Por eso se te quedan cortos. No es que uses mal el plan. El plan no está hecho para tu volumen.
Alquilar GPU y servirlo tú
Una 4090 Community en RunPod está a $0,34/h ($0,74 en Secure). Vast.ai baja a ~$0,13–0,35 según host. A40 48 GB Community: $0,35/h — mejor si quieres contexto largo. H100 Community: $1,99/h, solo si te importa la latencia, no el precio.
| Máquina | $/h | 8 h × 22 d | 12 h × 30 d | 24/7 |
|---|---|---|---|---|
| Vast 4090 (suelo típico) | 0,20 | $35 | $72 | $146 |
| RunPod 4090 Community | 0,34 | $60 | $122 | $248 |
| RunPod A40 Community | 0,35 | $62 | $126 | $256 |
| RunPod 4090 Secure | 0,74 | $130 | $266 | $540 |
| RunPod A100 Community | 1,19 | $209 | $428 | $869 |
| RunPod H100 Community | 1,99 | $350 | $716 | $1.453 |
RunPod oficial, 17 ago 2026 (Community vs Secure en el schema de la página). Vast es mercado: el precio se mueve. Apaga el pod. El disco parado en RunPod se cobra más caro que encendido.
Si solo codeas 2–4 h al día
Ahí la GPU no compite con 24/7. Compite con el reloj de tu sesión. Pagas las horas que está encendida, da igual que el modelo esté pensando, esperando a que compiles o a que tú leas el diff.
2 h = 15 $ · 3 h = 22 $ · 4 h = 30 $. Suma ~15 min de arranque: +2–3 $.
2 h suaves ~35 $. 4 h a full con thinking ~100–120 $. Grok/Claude API: 200 $ para arriba.
| Horas/día × 22 d | Vast 0,20 $ | 4090 0,34 $ | A40 0,35 $ |
|---|---|---|---|
| 2 h | $9 | $15 | $15 |
| 3 h | $13 | $22 | $23 |
| 4 h | $18 | $30 | $31 |
| 4 h × 30 días | $24 | $41 | $42 |
| Se te olvida y queda 24/7 | $146 | $248 | $256 |
En 2–4 h “a full” no estás generando 2–4 h seguidas. El agente espera, tú lees, el compilador corre. En API eso es gratis. En GPU lo pagas igual. Aun así, si esas horas son de Cline/OpenCode con thinking, sueles quemar de 8 a 30 M de output al mes. A 3 $/M eso son 24–90 $ solo de thinking. La GPU se come ese output a precio de reloj.
Empate solo en el extremo flojo: 2 h, thinking en medium/low, poco agente. Chutes puede salir por ~25–40 $, casi lo mismo que la 4090 y sin montar nada. En cuanto pases de ~8 M de output al mes (un par de tardes pesadas), la GPU ya gana.
Si los planes de 20–30 $ se te quedan cortos en 2–4 h, no eres el caso flojo. Eres el de 50–80 M de input. Ahí: GPU 20–30 $ + SuperGrok 30 $ de backup = ~50–60 $, y no te echan.
Truco: volumen de red en RunPod/Vast para no bajar el GGUF cada día. Arranque 2–4 min, no 15. Programa el stop o te come el mes un pod olvidado.
Coste por millón si la GPU está generando
En 4090 a ~50 tok/s de decode y $0,34/h: ~$1,90 / 1M de output. El prefill (el repo que reenvías) sale a céntimos, ~$0,05 / 1M. Frente a $0,40 / $3,00 de Chutes, ganas en los dos lados — sobre todo en thinking.
Si la GPU está al 20 % porque dejas el pod 24/7 “por si acaso”, el output efectivo se te pone ~$9 / 1M y la API gana. Por eso el truco no es tenerla siempre encendida. Es encenderla cuando te sientas a picar.
Comprar una 4090 usada: 1.200–1.800 € + luz (~15–25 €/mes a 8 h, 350 W, 0,20 €/kWh). Sale si vas a usarla un año. En un VPS sin GPU, alquilar.
Tres modos de uso
Cifras redondas de un coder. El agente reenvía contexto (mucho input). El thinking infla el output. Si usas cache, el input fresco baja; el output no.
| Ruta | Normal 15M+5M |
Heavy 80M+30M |
Agente 8h 250M+80M |
|---|---|---|---|
| GPU 4090 Community, 8–12 h | $60 | $60–122 | $122–248 |
| Qwen 27B Chutes | $21 | $122 | $340 |
| Qwen 27B + 70% cache | $18 | $102 | $277 |
| Qwen 3.6-27B (más barato, peor) | $16 | $95 | $264 |
| Grok 4.6 / Qwen Max API | $60 | $340 | $980 |
| Claude Sonnet 5 API | $80 | $460 | $1.300 |
| Claude Opus 5 API | $200 | $1.150 | $3.250 |
| Cursor Ultra / Claude Max 20× | $200 + techo | $200 + techo | se acaba |
| SuperGrok Heavy | $300 + techo | $300 + techo | se acaba |
Normal (unas decenas de chats, poco agente): API del 27B a $20. Ni GPU ni plan gordo.
Heavy en 2–4 h (tu caso real): GPU a 15–32 $. Chutes 35–120 $ según el thinking. Grok/Claude API, 200 $ para arriba. Los planes de 20–30 $ se acaban igual porque el techo es por tokens, no por horas.
Heavy 8–12 h: empate técnico entre Chutes ~122 $ y una 4090 12 h ~122 $. La GPU gana en cuanto el thinking se dispara. Y no te echan.
Agente 8 h (Cline/OpenCode/Claude Code contra un repo, todo el santo día): GPU, sin discusión. La API del 27B se va a $340 y Claude/Grok a cuatro cifras. Un Ultra de $200 te corta a mitad de mes.
Calculadora
Mueve los sliders. Mezcla típica de agente: más input que output, salvo que dejes xhigh todo el rato.
Cómo montarlo barato, en serio
- Hoy, mientras pruebas: OpenRouter, modelo
qwen/qwen3.8-27b, provider Chutes.reasoning_effort: "medium". Desactivapreserve_thinkingen hilos largos. Eso solo ya te baja el output a la mitad o más. - La semana que viene: Vast.ai o RunPod Community. Primero 4090. Si el contexto se te queda corto, A40 48 GB al mismo precio.
- Imagen con CUDA. Baja el GGUF Unsloth
UD-Q4_K_XL. Llama-server con MTP. En Blackwell (5090/B200), NVFP4 + vLLM va ~1,5× más rápido. - Túnel SSH o el proxy de RunPod. En el portátil, Cline / OpenCode / Continue / Aider apuntando a
http://127.0.0.1:8080/v1. Misma API que OpenAI. - Apaga el pod. Un cron o el botón. 24/7 solo si de verdad lo usas de madrugada.
- Deja SuperGrok $30 (o Claude Pro $20) para arquitectura, reviews feas y cuando el 27B se empantane. No pagues el plan de $200–300 “por si acaso”.
Comando que está usando gente en r/LocalLLaMA, Q4 Unsloth + MTP, 64k:
llama-server -ngl 999 -c 65536 -b 2048 -ub 256 \
--flash-attn on --cache-type-k q8_0 --cache-type-v q8_0 \
--spec-type draft-mtp --spec-draft-n-max 2 \
--temp 1.0 --top-p 0.95 --top-k 20 \
--jinja --reasoning on --reasoning-preserve \
--chat-template-kwargs '{"preserve_thinking":true,"reasoning_effort":"medium"}' \
-m Qwen3.8-27B-UD-Q4_K_XL.gguf
vLLM en una 5090 (NVFP4, 32k; sin --enforce-eager se queda sin VRAM al capturar grafos):
vllm serve unsloth/Qwen3.8-27B-NVFP4 \ --max-model-len 32768 --kv-cache-dtype fp8 \ --enforce-eager --reasoning-parser qwen3 \ --enable-auto-tool-choice --tool-call-parser qwen3_coder
Dónde se va el dinero si no tienes cuidado
xhighpor defecto. Para un rename o un test,lowo thinking off.preserve_thinkingreinyecta el razonamiento viejo. En un hilo de 40 turnos el input se hincha. Útil en agentes largos, caro en API.- Contexto de 200k “porque puedes”. En 4090 te comes la VRAM y el prefill se pone lento. 32–64k cubre casi todo el coding.
- Dejar el pod encendido. $0,34 × 24 × 30 = $245 de vicio.
Fuentes
- Qwen/Qwen3.8-27B — ficha, benches, Apache 2.0
- OpenRouter · endpoints — Chutes $0,40/$3,00
- Unsloth — VRAM 17–19 GB @ 4-bit, settings
- vLLM recipe — 5090, NVFP4, KV
- RunPod pricing — 4090 Community $0,34 / Secure $0,74
- x.ai/pricing — SuperGrok $30, Plus $100. Heavy $300 en x.ai/bot
- claude.com/pricing — Pro $20, Max desde $100; API Sonnet 5 $2/$10, Opus 5 $5/$25
- cursor.com/pricing — Pro $20; Pro+ $60 y Ultra $200 en desgloses de 2026
- docs.x.ai — Grok 4.6 $2/$6