Poolside ha lanzado Laguna S 2.1 , su modelo de codificación más potente disponible públicamente hasta la fecha.

Poolside ha lanzado Laguna S 2.1, su modelo de codificación más potente disponible públicamente hasta la fecha.
Este modelo está diseñado para ingeniería de software basada en agentes y tareas de ciclo largo. Cuenta con 118 mil millones de parámetros totales, activando aproximadamente 8 mil millones de parámetros por token, y admite una ventana de contexto de hasta 1,048,576 tokens tanto en modo de pensamiento como sin pensamiento.
Poolside ha publicado los pesos del modelo bajo la licencia OpenMDW-1.1. La compañía también ofrece varios formatos oficiales de checkpoint y cuantización a través de Hugging Face, mientras que OpenCode proporciona una versión alojada gratuita por tiempo limitado.
Estos detalles hacen de Laguna S 2.1 un lanzamiento excepcional. Está diseñado para ofrecer un rendimiento robusto como agente de codificación sin necesidad de pasar cada token por la red completa de 118 mil millones de parámetros, y puede ser desplegado de forma privada por equipos con hardware suficientemente potente.
Al mismo tiempo, varias declaraciones en torno a este lanzamiento deben contextualizarse. Las puntuaciones de referencia son reportadas principalmente por Poolside, no todos los proveedores de alojamiento expondrán la capacidad completa de 1 millón de tokens, y el hecho de que sea "lo suficientemente pequeño para ejecutarse en una DGX Spark" no significa que el modelo funcione sin problemas en un portátil de desarrollo normal.

Laguna S 2.1 es un modelo base de texto a texto, entrenado específicamente para ingeniería de software, trabajo en terminal, uso de herramientas y flujos de trabajo de agentes de codificación.
Se sitúa entre otros dos modelos de Poolside:
| Modelo | Parámetros totales | Parámetros activados por token | Ventana de contexto | Posicionamiento |
|---|---|---|---|---|
| Laguna XS 2.1 | 33B | 3B | 256K | Codificación local más rápida y de ciclo corto |
| Laguna S 2.1 | 118B | ~8B | 1M | Codificación de agente de ciclo largo más potente |
| Laguna M.1 | 225B | 23B | 256K | Modelo más grande para tareas de agente complejas |
Poolside afirma que Laguna S 2.1 tardó menos de nueve semanas desde el inicio del entrenamiento hasta su lanzamiento. Está entrenado sobre la misma serie de datos de preentrenamiento que Laguna XS 2.1, logrando mejoras de rendimiento mediante escalado, correcciones de código de entrenamiento, cambios en la receta y nuevo trabajo de post-entrenamiento.
La compañía describe a S 2.1 como su modelo más potente actual para desarrollo de funciones diarias, cambios en múltiples archivos, tareas de terminal y sesiones de codificación más largas.
La ficha técnica oficial del modelo enumera la siguiente arquitectura:
| Especificación | Laguna S 2.1 |
|---|---|
| Arquitectura | Mezcla de expertos |
| Parámetros totales | 118B |
| Parámetros activados | ~8B por token |
| Número de capas | 48 |
| Capas de atención global | 12 |
| Capas de ventana deslizante | 36 |
| Tamaño de ventana deslizante | 512 tokens |
| Número de expertos enrutados | 256 |
| Número de expertos seleccionados | Top 10 |
| Número de expertos compartidos | 1 |
| Ventana de contexto | 1,048,576 tokens |
| Modalidad | Entrada y salida de texto |
| Razonamiento | Pensamiento intercalado, controlable por solicitud |
| Tamaño del vocabulario | 100,352 tokens |
El modelo utiliza atención de consultas agrupadas y una combinación de atención global y de ventana deslizante. Poolside también proporciona un modelo borrador DFlash entrenado...
Cuando la pila de inferencia lo admite, este modelo reduce la latencia del servicio.
Laguna S 2.1 contiene 118 mil millones de parámetros, pero no todos se activan para cada token.
Su enrutador selecciona un subconjunto de expertos para cada token, con aproximadamente 8 mil millones de parámetros participando realmente en el cálculo. Esta es la razón principal por la que Poolside afirma que el modelo es más eficiente que un modelo denso de tamaño similar.
Tabla comparativa simplificada:
| Modelo denso | Modelo de mezcla de expertos |
|---|---|
| La mayoría de los parámetros participan por token | Solo los expertos seleccionados participan |
| El cómputo crece con el tamaño total | El cómputo puede ser muy inferior al tamaño total |
| Comportamiento de enrutamiento simple | Enrutamiento y servicio más complejos |
| La memoria depende de los pesos completos del modelo | La memoria también depende de los pesos completos y la precisión seleccionada |
No confunda la eficiencia computacional con un bajo consumo de memoria.
Incluso si solo se activan 8 mil millones de parámetros por token, el sistema necesita acceder a los pesos completos de los expertos. Los archivos GGUF oficiales muestran el tamaño real:
| Archivo GGUF oficial | Tamaño aproximado |
|---|---|
| F16 | 235 GB |
| Q8_0 | 128 GB |
| Q4_K_M | 75 GB |
| Modelo borrador DFlash BF16 | 2,2 GB |
La versión cuantizada a 4 bits es más manejable que el modelo de precisión completa, pero 75 GB aún requieren una estación de trabajo con memoria unificada extremadamente alta o memoria acelerada, además de espacio adicional para el caché de contexto y el tiempo de ejecución.
El modelo base admite una longitud máxima de contexto de 1,048,576 tokens.
Para los agentes de codificación, una ventana de contexto grande es útil en las siguientes tareas:
El límite de un millón de tokens no significa que cada solicitud deba llenar toda la ventana.
Los contextos largos aumentan el uso de memoria, el tiempo de precarga y el costo del servicio. También pueden introducir información irrelevante, lo que dificulta el trabajo del modelo. Un buen marco de agente de codificación aún necesita funciones de selección de archivos, recuperación, resumen, almacenamiento en caché y gestión de contexto.
Las plataformas de alojamiento pueden exponer límites de contexto inferiores a los admitidos por el modelo subyacente. El anuncio de lanzamiento de OpenCode afirma soportar un contexto de 1 millón, pero antes de diseñar flujos de trabajo en torno al valor máximo, los usuarios deben consultar la entrada actual del modelo y las políticas del proveedor. Los puntos finales gratuitos o de vista previa pueden ajustar los límites de contexto y la disponibilidad en cualquier momento.
Laguna S 2.1 admite dos modos: con razonamiento habilitado y sin pensamiento.
En las API de inferencia compatibles, el modo de razonamiento se puede controlar por solicitud mediante la opción enable_thinking.
Cada modo es adecuado para diferentes tareas:
Este modo es adecuado para trabajos que requieren planificación y razonamiento intermedio, como:
El modo sin pensamiento es más adecuado para escenarios como:
El modo de razonamiento no se aplica automáticamente a todas las tareas. Por lo general, consume más tokens y lleva más tiempo. Los equipos deben evaluar ambos modos en sus propios repositorios y medir los resultados a través de la tasa de finalización de tareas, no solo basándose en la calidad subjetiva de la salida.
Poolside ha publicado los siguientes resultados de prueba para Laguna S 2.1:
| Benchmark | Puntuación reportada |
|---|---|
| Terminal-Bench 2.1 | 70.2 % |
| SWE-Bench Multilingüe | 78.5 % |
| SWE-Bench Pro (conjunto de datos público) | 59.4 % |
| DeepSWE | 40.4 % |
| SWE Atlas (Preguntas y respuestas sobre repositorios) | 46.2 % |
| Toolathlon Verificado | 49.7 % |
Poolside indica que la mayoría de las puntuaciones se basan en la métrica pass@1 y son el promedio de múltiples ejecuciones. Su archivo de trayectoria pública...
Registro de ejecución de Terminal-Bench 2.1, que permite a los desarrolladores comprender más claramente el proceso de cómo un agente maneja tareas específicas.
Los resultados muestran que Laguna S 2.1 es competitivo en comparación con modelos de mayor tamaño total de parámetros.
Sin embargo, las tablas de evaluación deben interpretarse con cautela.
Los resultados pueden variar según los siguientes factores:
La página del modelo de Poolside explica que sus tablas comparativas pueden usar los datos más altos de modelos competidores obtenidos de informes de proveedores, rankings de evaluación o clasificaciones de terceros. Este método es adecuado para comparaciones a nivel macro, pero difiere de probar todos los modelos bajo una configuración de evaluación unificada.
La conclusión más segura es: Laguna S 2.1 muestra un rendimiento sólido en su categoría de parámetros efectivos. Los equipos que seleccionen modelos de codificación de nivel de producción aún deben realizar pruebas con sus propios conjuntos de problemas, repositorios de código, cadenas de herramientas y estándares de revisión.
Poolside ha publicado Laguna S 2.1 bajo la licencia OpenMDW-1.1, una licencia de materiales de modelo mantenida por el proyecto OpenMDW.
Esta licencia otorga a los usuarios derechos amplios para usar, modificar y redistribuir gratuitamente los materiales del modelo, siempre que se cumplan los términos. Al redistribuir, se debe conservar la licencia y las declaraciones de derechos de autor o fuente correspondientes.
Además, el contenido generado mediante el uso del modelo no está sujeto a las restricciones de la licencia.
En la práctica, los desarrolladores deben distinguir los siguientes términos:
Laguna S 2.1 se publica explícitamente como pesos abiertos. Poolside y OpenCode trabajan juntos para promover el desarrollo y la aplicación de la tecnología de inteligencia artificial.
En los materiales de publicación se utiliza una expresión más fuerte como "código abierto", pero las organizaciones deben revisar el texto real de OpenMDW-1.1, las guías de uso responsable de Poolside, las dependencias de terceros y sus propios requisitos legales antes de redistribuir o implementar comercialmente.
Esta licencia también proporciona los materiales del modelo "tal cual", sin garantía alguna. Los usuarios siguen siendo responsables de probar la exactitud, seguridad, idoneidad y cumplimiento normativo.
OpenCode ha anunciado que, durante el período promocional, Laguna S 2.1 se puede usar de forma gratuita a través de OpenCode Zen, sin pagar tarifas de uso del modelo.
Esto proporciona a los usuarios una forma de probar con barreras de entrada bajas, sin necesidad de descargar archivos de punto de control de 75-235 GB ni ejecutar hardware de inferencia local.
La documentación de OpenCode señala dos detalles importantes:
Por lo tanto, los usuarios deben evitar enviar:
La vista previa gratuita es adecuada para repositorios de código públicos, proyectos sintéticos y evaluaciones de bajo riesgo. Solo se deben usar códigos privados de la empresa para pruebas después de revisar las políticas de datos actuales, términos de retención, controles de espacio de trabajo y las opciones de pago o autoalojamiento disponibles de la plataforma.
OpenCode se puede instalar a través de su instalador oficial:
curl -fsSL https://opencode.ai/install | bash
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
Una vez instalado, conéctese a OpenCode Zen y seleccione el modelo gratuito Laguna S 2.1 que aparece actualmente.
Durante la vista previa, el nombre exacto del modelo, los límites de contexto, los límites de uso y la disponibilidad pueden cambiar. Antes de iniciar tareas de larga duración, consulte la documentación de OpenCode Zen y el selector de modelos.
La tarjeta oficial del modelo en Hugging Face proporciona el siguiente comando:
docker model run hf.co/poolside/Laguna-S-2.1
El tamaño de descarga y la memoria necesaria dependen del formato seleccionado en tiempo de ejecución. Revise los archivos del modelo antes de descargarlos a su estación de trabajo o servidor.
Poolside proporciona un repositorio GGUF oficial y una bifurcación de llama.cpp compatible con Laguna.
git clone --branch laguna https://github.com/poolsideai/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build -j
./build/bin/llama-server \
-hf poolside/Laguna-S-2.1-GGUF:Q4_K_M \
--jinja \
--port 8000
El archivo Q4_K_M tiene aproximadamente 75 GB. El sistema también necesita memoria para la sobrecarga de ejecución y la caché KV, especialmente cuando se usan contextos largos.
Las instrucciones oficiales incluyen un modelo borrador DFlash opcional:
./build/bin/llama-server \
-m laguna-s-2.1-Q4_K_M.gguf \
-md laguna-s-2.1-DFlash-BF16.gguf \
--spec-type draft-dflash \
--spec-draft-n-max 15 \
-fa on \
--jinja \
--port 8000
La decodificación especulativa puede mejorar la velocidad de generación, pero los resultados dependen del hardware, la forma del prompt, la longitud del contexto, la configuración de compilación y la tasa de aceptación del modelo borrador.
Poolside afirma que Laguna S 2.1 es lo suficientemente pequeño como para ejecutarse en una sola NVIDIA DGX Spark.
Esto es factible para un punto de control cuantificado adecuado, ya que DGX Spark está diseñado con una gran configuración de memoria unificada. Pero esto no significa que todos los formatos de modelo, tamaños de contexto o modos de servicio se adapten inmediatamente.
Los usuarios deben hacerse cuatro preguntas por separado:
Un modelo que teóricamente se puede cargar puede seguir siendo demasiado lento para la codificación interactiva con longitudes de contexto extremas. El rendimiento, el tiempo hasta el primer token, el consumo de energía y las cargas de trabajo concurrentes requieren mediciones independientes.
El informe inicial de AIBase citó pruebas de la comunidad realizadas en un sistema Apple M3 Max con 128 GB de memoria unificada y la bifurcación llama.cpp de Poolside.
El punto de control Q4_K_M de 75 GB hace que este tipo de implementación sea técnicamente creíble, pero la experiencia variará significativamente según:
Los informes de la comunidad no deben considerarse como recomendaciones de hardware fiables. Los desarrolladores deben consultar los tamaños de archivo oficiales y reservar suficiente margen de memoria antes de descargar el modelo.
Laguna S 2.1 refleja varios cambios más amplios en el campo de los modelos de codificación.
Un gran número total de parámetros puede proporcionar capacidad, mientras que la activación dispersa ayuda a controlar la cantidad de cálculo por token.
Esto permite una entrega de servicios más eficiente y una experiencia de menor latencia en aplicaciones de codificación de agentes.
La arquitectura MoE resulta más atractiva para agentes de codificación que podrían ejecutarse durante minutos u horas.
Las ventanas de millones de tokens solían asociarse principalmente con modelos propietarios alojados. Su aparición en modelos de codificación de pesos abiertos otorga a los equipos un mayor control sobre experimentos con repositorios extensos y despliegues privados.
Poolside entrena sus modelos Laguna dentro de su propio marco de agentes y afirma que estos modelos rinden mejor en ese entorno o en clientes compatibles con el Protocolo de Cliente de Agentes (ACP).
Los benchmarks de codificación evalúan sistemas compuestos por modelo y agente, no solo la capacidad predictiva del siguiente token. El uso de herramientas, la selección de contexto, la lógica de reintentos, el acceso a terminales y la aplicación de parches afectan significativamente el rendimiento.
Las organizaciones pueden inspeccionar los archivos, elegir su propio tiempo de ejecución, cuantizar el modelo, desplegarlo en infraestructura privada y conectarlo a agentes de codificación internos.
Esta flexibilidad es valiosa para entornos que manejan código fuente sensible a la privacidad y con acceso restringido a la red.
La ficha técnica oficial describe a Laguna S 2.1 como un modelo texto a texto. No es un modelo nativo para imágenes, audio o video.
Su cantidad de parámetros activos es relativamente pequeña, pero el peso completo del modelo sigue siendo grande. Un portátil normal no será adecuado para el formato oficial de alta calidad.
La capacidad máxima de un millón de tokens no equivale a un procesamiento eficiente de esa magnitud en el uso diario. La latencia de precarga y la memoria caché KV pueden volverse considerables.
Una puntuación de programación pública destacada no garantiza el mismo rendimiento con la combinación de lenguajes, sistemas de compilación, estándares de codificación o marcos privados de una empresa.
La documentación del período gratuito de OpenCode indica que las entradas y salidas recopiladas pueden utilizarse para mejorar el modelo. No se debe enviar código confidencial sin una política aprobada.
Cualquier agente de programación, al obtener permisos amplios, podría eliminar archivos, ejecutar comandos, cambiar dependencias o introducir vulnerabilidades de seguridad.
Uso:
Laguna S 2.1 es más adecuado para:
Podría no ser adecuado para:
Laguna S 2.1 es un modelo de mezcla de expertos (MoE) con 118 mil millones de parámetros, diseñado para programación con agentes y tareas de ingeniería de software de ciclo largo. Activa unos 8 mil millones de parámetros por token y admite una ventana de contexto de hasta 1,048,576 tokens.
Sus pesos están disponibles públicamente bajo la licencia OpenMDW-1.1, por lo que “pesos abiertos” es la descripción más clara. Los usuarios deben revisar el acuerdo de licencia, la documentación del modelo, las pautas de uso aceptable y cualquier componente de terceros antes de redistribuirlo o desplegarlo comercialmente.
OpenCode ofrece actualmente una opción gratuita de Laguna S 2.1 por tiempo limitado. La disponibilidad, los límites de contexto, los límites de velocidad y los términos de uso de datos pueden cambiar; por lo tanto, verifique la documentación actual de OpenCode Zen antes de confiar en él.
El anuncio de OpenCode promociona contexto de un millón de tokens, coherente con la capacidad máxima del modelo base. Los puntos finales alojados pueden imponer límites diferentes, así que verifique la configuración del modelo activo en OpenCode antes de enviar contextos muy largos.
Informes de la comunidad indican que las versiones cuantizadas pueden ejecutarse en sistemas Apple Silicon con alta memoria, incluyendo configuraciones M3 Max de 128 GB. El rendimiento y el contexto utilizable dependen del método de cuantización, el entorno de ejecución, la memoria disponible y la carga del sistema.
Poolside afirma que una versión adecuada puede ejecutarse en una sola NVIDIA DGX Spark. La longitud de contexto alcanzable, la velocidad de tokens y la concurrencia dependen del formato del punto de control y la configuración del servicio.
Poolside reporta un 70.2% en Terminal-Bench 2.1, un 78.5% en SWE-Bench Multilingual, un 59.4% en el conjunto de datos público SWE-Bench Pro y un 40.4% en DeepSWE. Estos datos deben evaluarse junto con los métodos de prueba de la empresa y pruebas independientes.
Sí. La ficha técnica oficial indica que admite razonamiento intercalado y permite habilitar o deshabilitar el razonamiento por solicitud en sistemas de servicio compatibles.
Directorio de modelos de Poolside: Comparación oficial de Laguna S 2.1, XS 2.1 y toda la familia de modelos Laguna.
Poolside Laguna S 2.1 cuenta con un total de 118B parámetros, aproximadamente 8B parámetros activos por token, una ventana de contexto de un millón de tokens, inferencia controlable y pesos abiertos oficialmente disponibles en varios formatos.
Poolside reporta un rendimiento sólido en pruebas de referencia de terminal e ingeniería de software, incluyendo un 70.2% en Terminal-Bench 2.1 y un 40.4% en DeepSWE. Estos resultados sitúan al modelo como destacado dentro de su categoría de tamaño, aunque los equipos deberían reproducir el rendimiento en sus propios repositorios y marcos de agentes.
El acceso gratuito limitado de OpenCode facilita la prueba del modelo, mientras que los pesos descargables permiten el despliegue privado, pero a costa de enormes requisitos de memoria, cambios en las políticas del servicio de alojamiento y riesgos operativos normales para agentes de codificación autónomos.
Laguna S 2.1 es un lanzamiento significativo de pesos abiertos para tareas de codificación de ciclo largo, pero su verdadero valor dependerá de la integración de agentes, la eficiencia del despliegue y el rendimiento en trabajos de desarrollo reales, más allá de la etiqueta de un millón de tokens de contexto.
Empieza con una sola frase y obtén un sitio completo en minutos.