Volver al blog

Laguna S 2.1: el modelo open-weight que cambia el juego en agentic coding

Laguna S 2.1: el modelo open-weight que cambia el juego en agentic coding

Laguna S 2.1: el modelo open-weight que cambia el juego en agentic coding

📌 TL;DR — Poolside acaba de publicar Laguna S 2.1, un modelo Mixture-of-Experts de 118.000 millones de parámetros totales con solo 8.000 millones activos por token, diseñado específicamente para agentic coding y tareas de largo horizonte. Soporta hasta 1 millón de tokens de contexto, sus pesos son descargables bajo licencia comercial OpenMDW-1.1 y puede ejecutarse en hardware empresarial razonable. Para empresas que necesitan agentes de desarrollo internos sin ceder código a terceros, esta publicación merece atención.


El problema que Laguna S 2.1 intenta resolver

Cuando una empresa quiere integrar un asistente de IA en su flujo de desarrollo de software, se enfrenta a un dilema incómodo: los modelos más capaces para programación son propietarios y requieren enviar código a servidores externos. Eso choca frontalmente con políticas de seguridad, requisitos de soberanía de datos o simplemente con el sentido común cuando el código fuente es el activo diferencial del negocio.

Las alternativas open-weight existentes han sido históricamente inferiores en tareas de programación compleja, especialmente en lo que se llama agentic coding: no solo completar una función, sino razonar sobre un repositorio entero, ejecutar herramientas, interpretar resultados, corregir errores y mantener el estado de una tarea durante decenas de pasos encadenados.

Eso es exactamente el espacio que Poolside quiere ocupar con Laguna S 2.1.


Qué es Laguna S 2.1 y cómo funciona

Laguna S 2.1 es un modelo Mixture-of-Experts (MoE) con 118.000 millones de parámetros totales y 8.000 millones de parámetros activos por token [1][5][6][8][10]. La distinción es importante: en una arquitectura MoE, el modelo no activa todos sus parámetros para cada token que procesa. Solo activa un subconjunto —los "expertos" más relevantes— lo que reduce drásticamente el coste computacional por inferencia sin sacrificar la capacidad total del modelo.

El resultado práctico es que Laguna S 2.1 se comporta como un modelo grande en términos de conocimiento y razonamiento, pero consume recursos de cómputo más cercanos a un modelo de 8B parámetros densos. Eso es lo que permite ejecutarlo en un único NVIDIA DGX Spark, según las especificaciones de Poolside [1][6][9][10].

Arquitectura técnica relevante

Más allá del tamaño, hay detalles de arquitectura que explican parte de su rendimiento en tareas largas [5][8]:

  • Atención mixta: combina sliding-window attention (eficiente para tokens cercanos) con global attention (para capturar dependencias lejanas), lo que permite gestionar contextos largos sin el coste cuadrático de la atención completa.
  • FP8 KV cache: reduce la memoria necesaria para almacenar el estado de atención durante la inferencia, clave cuando trabajas con contextos de cientos de miles de tokens.
  • Gating por cabeza: un mecanismo de selección más granular dentro de la arquitectura de atención.
  • Soporte nativo para razonamiento intercalado y llamadas a herramientas: el modelo no necesita adaptadores externos para funcionar en pipelines agénticos; está diseñado para ello desde la base.

La ventana de 1 millón de tokens

Este es el dato que más impacto tiene en casos de uso reales. Laguna S 2.1 soporta hasta 1 millón de tokens de contexto tanto en modo thinking (con razonamiento explícito paso a paso) como en modo no-thinking [1][6][8][10].

Para dar escala: 1 millón de tokens equivale aproximadamente a 750.000 palabras, o a varios repositorios de código medianos completos cargados simultáneamente. Eso significa que un agente puede tener acceso persistente a todo el contexto de un proyecto —código, documentación, historial de errores, estado de herramientas— sin necesidad de fragmentar artificialmente la información ni perder coherencia entre pasos.


Rendimiento en benchmarks: qué dicen los números y qué no dicen

Poolside reporta que Laguna S 2.1 alcanza aproximadamente un 70,2% en Terminal-Bench 2.1 con modo thinking, situándose al nivel o por encima de modelos entre 5 y 25 veces más grandes, como DeepSeek-V4-Flash y NVIDIA Nemotron 3 Ultra [1][2][6][10].

Eso es un resultado llamativo. Un modelo con 8B parámetros activos compitiendo con modelos masivos en un benchmark de programación en terminal sugiere que la especialización funciona.

Sin embargo, hay que leer estos números con criterio:

Terminal-Bench 2.1 y DeepSWE son benchmarks exigentes y representativos de tareas de coding real, pero no cubren el espectro completo de lo que un LLM puede necesitar hacer en un entorno empresarial: razonamiento general, generación de texto no técnico, análisis de datos no estructurados, idiomas distintos al inglés, etc. [1][2][6][7][10]

Al ser un modelo open-weight relativamente nuevo, aún no existe un cuerpo amplio e independiente de evaluaciones de seguridad, robustez y comportamiento fuera de los entornos de prueba definidos por Poolside y sus colaboradores [7][8][10]. Las evaluaciones internas son un punto de partida, no una garantía.

Dicho esto, para el caso de uso específico para el que está diseñado —agentes de desarrollo de software con tareas largas— los números son suficientemente sólidos como para tomarlo en serio.


Distribución, licencia y opciones de despliegue

Los pesos de Laguna S 2.1 se publican en Hugging Face bajo la licencia OpenMDW-1.1 [5][6][8][9][10]. Esta licencia permite uso comercial, pero tiene restricciones específicas sobre redistribución y modelos derivados que conviene revisar antes de cualquier despliegue productivo.

Los formatos disponibles son BF16, FP8, INT4 y NVFP4, con cuantizaciones oficiales GGUF y MLX [5][6][8][9][10]. Esto cubre prácticamente todo el ecosistema de inferencia local:

  • vLLM y SGLang para despliegues en servidor con alto rendimiento
  • Ollama y llama.cpp para entornos más ligeros o pruebas locales
  • MLX para hardware Apple Silicon
  • TensorRT-LLM para optimización en GPUs NVIDIA

Además del self-hosting, el modelo también está disponible a través de APIs externas: Poolside API, OpenRouter, Baseten, Vercel AI Gateway y Kilo [1][6][8][9][10]. Esto permite empezar a evaluar sin necesidad de infraestructura propia.


Por qué importa esto a tu empresa o proyecto

Para empresarios y responsables de tecnología

La combinación de pesos abiertos, licencia comercial y capacidad de ejecución on-premise resuelve el dilema que mencionaba al principio. Si tienes código propietario, requisitos de cumplimiento normativo o simplemente no quieres que tu base de código pase por servidores de terceros, Laguna S 2.1 ofrece una alternativa técnicamente competitiva.

El hecho de que pueda correr en un DGX Spark —hardware caro pero accesible para empresas medianas con necesidades serias de IA— lo pone en un rango diferente a los modelos que requieren clústeres de decenas de GPUs para inferencia razonable [1][6][9][10].

La dependencia de proveedores cerrados no es solo un riesgo de privacidad; también es un riesgo de negocio. Los precios cambian, las APIs se deprecan, las condiciones de uso se modifican. Tener los pesos de un modelo competitivo bajo tu control es una posición estratégicamente más sólida.

Para desarrolladores

La ventana de 1M tokens combinada con soporte nativo para herramientas y razonamiento intercalado abre posibilidades que con modelos de contexto estándar (32K-128K tokens) simplemente no son viables [1][5][6][8][10]:

  • Cargar un repositorio completo y hacer preguntas sobre él sin chunking
  • Mantener el estado de una sesión de debugging larga sin perder contexto
  • Ejecutar pipelines agénticos con múltiples llamadas a herramientas sin que el modelo "olvide" el objetivo inicial
  • Trabajar con documentación técnica extensa junto al código de forma simultánea

La disponibilidad en múltiples runtimes también reduce la fricción de integración. Si ya tienes un stack con vLLM o llama.cpp, el modelo encaja sin cambios de infraestructura.


Lecciones accionables

  1. Evalúa Laguna S 2.1 para agentes de desarrollo internos antes de comprometerte con APIs cerradas. Si la privacidad del código es un requisito no negociable, este modelo merece estar en tu shortlist. Empieza con los formatos cuantizados (INT4, GGUF) para reducir el coste de la prueba de concepto [1][8][9][10].

  2. Rediseña tus flujos de trabajo de programación asistida pensando en contexto largo. La ventana de 1M tokens no es solo un número de marketing; cambia lo que es posible. Un agente con acceso persistente a todo el repositorio, la documentación y el historial de errores funciona de forma cualitativamente diferente a uno que trabaja con fragmentos [1][5][8][10].

  3. No adoptes en producción sin evaluación propia. Los benchmarks de Poolside son un buen indicador, pero Terminal-Bench 2.1 y DeepSWE no cubren todos los escenarios. Diseña un conjunto de pruebas representativo de tus casos de uso reales antes de cualquier despliegue masivo [2][6][7][10].

  4. Lee la licencia OpenMDW-1.1 antes de construir sobre ella. Las licencias de modelos open-weight tienen matices importantes sobre redistribución, modelos derivados y usos específicos. Si vas a integrar Laguna S 2.1 en un producto comercial o a hacer fine-tuning, necesitas entender exactamente qué permite y qué no [1][8][9].

  5. Aprovecha las cuantizaciones oficiales para optimizar costes de infraestructura. La diferencia entre BF16 y INT4 en consumo de memoria puede ser de 4x, con una pérdida de rendimiento que en muchos casos es aceptable. Poolside publica cuantizaciones oficiales, lo que reduce el riesgo de degradación por cuantización mal implementada [5][6][9][10].


Una nota sobre el contexto competitivo

Poolside posiciona Laguna S 2.1 como su modelo más capaz hasta la fecha para tareas de programación y agentes, por encima de su propia familia Laguna XS [3][6][7][8][9]. El mercado de modelos especializados en coding se está moviendo rápido, con actores como DeepSeek, NVIDIA y otros publicando modelos competitivos en rangos de parámetros similares.

Lo que diferencia a Laguna S 2.1 no es un solo número en un benchmark, sino la combinación específica: especialización en agentic coding, contexto de 1M tokens, arquitectura MoE eficiente, pesos abiertos con licencia comercial y soporte en el ecosistema de inferencia existente. Ninguno de esos elementos por separado es único; la combinación sí es poco común.

Si los próximos meses traen evaluaciones independientes que confirmen el rendimiento en entornos reales, Laguna S 2.1 tiene potencial para convertirse en una referencia en despliegues on-premise de agentes de desarrollo.


Si estás valorando un agente de desarrollo para tu empresa

La decisión de adoptar un modelo como Laguna S 2.1 no es solo técnica. Implica definir qué tareas vas a automatizar, qué infraestructura tienes o puedes tener, cómo encaja con tus requisitos de seguridad y qué métricas vas a usar para medir el éxito.

Si estás en ese punto —o si simplemente quieres entender si algo así tiene sentido para tu contexto concreto— explícame tu caso en /contacto. Sin compromiso, sin plantillas genéricas.


Fuentes

[1] Poolside lanza Laguna S 2.1: 118B parámetros, 8B activos para coding — https://ecosistemastartup.com/poolside-laguna-s-2-1-118b-parametros-8b-activos-para-coding/

[2] Poolside Releases Laguna S 2.1, an Open-Weight Agentic Coding Model — https://www.marktechpost.com/2026/07/21/poolside-releases-laguna-s-2-1/

[3] Laguna S 2.1 Open-Weight Model for Agentic Coding and Long-Horizon Work (LinkedIn) — https://www.linkedin.com/posts/poolsideai_today-were-releasing-laguna-s-21-our-new-activity-7485379045451456513--GBk

[4] Poolside presenta Laguna S 2.1, su modelo de IA más capaz con 118B parámetros — https://www.diariobitcoin.com/startups-verticales/poolside-presenta-laguna-s-2-1-su-modelo-de-ia-mas-capaz-con-118b-de-parametros/

[5] poolside/Laguna-S-2.1 (vLLM recipe / spec) — https://recipes.vllm.ai/poolside/Laguna-S-2.1

[6] Introducing Laguna S 2.1 (blog oficial de Poolside) — https://poolside.ai/blog/introducing-laguna-s-2-1

[7] Laguna S 2.1 Open-Weight Model for Agentic Coding and Long-Horizon Work (LinkedIn) — https://www.linkedin.com/posts/poolsideai_today-were-releasing-laguna-s-21-our-new-activity-7485379045451456513--GBk

[8] Introducing Laguna S 2.1 (blog oficial de Poolside) — https://poolside.ai/blog/introducing-laguna-s-2-1

[9] poolside/Laguna-S-2.1 (vLLM recipe / spec) — https://recipes.vllm.ai/poolside/Laguna-S-2.1

[10] Poolside lanza Laguna S 2.1: 118B parámetros, 8B activos para coding — https://ecosistemastartup.com/poolside-laguna-s-2-1-118b-parametros-8b-activos-para-coding/