A Poolside lançou o Laguna S 2.1 , seu modelo de codificação mais forte disponível publicamente até o momento.

A Poolside lançou o Laguna S 2.1, seu modelo de codificação mais forte disponível publicamente até o momento.
O modelo é projetado para engenharia de software orientada a agentes e tarefas de longo ciclo. Ele possui 118 bilhões de parâmetros totais, com aproximadamente 8 bilhões de parâmetros ativados por token, e suporta uma janela de contexto de até 1.048.576 tokens nos modos de raciocínio e sem raciocínio.
A Poolside disponibilizou os pesos do modelo sob a licença OpenMDW-1.1. A empresa também oferece vários checkpoints oficiais e formatos de quantização via Hugging Face, enquanto a OpenCode disponibiliza uma versão hospedada gratuita por tempo limitado.
Esses detalhes fazem do Laguna S 2.1 um lançamento excepcional. Ele visa oferecer desempenho robusto para agentes de codificação sem exigir que todos os 118 bilhões de parâmetros da rede sejam processados a cada token, podendo ser implantado de forma privada por equipes com hardware suficientemente potente.
Ao mesmo tempo, várias declarações em torno deste lançamento devem ser contextualizadas. As pontuações em benchmarks são majoritariamente relatadas pela Poolside, nem todos os provedores de hospedagem exporão a capacidade total de 1 milhão de tokens, e a afirmação de que é "pequeno o suficiente para rodar em um DGX Spark" não significa que o modelo funcione suavemente em um notebook comum de desenvolvedor.

O Laguna S 2.1 é um modelo base texto-para-texto, especificamente treinado para engenharia de software, tarefas de terminal, uso de ferramentas e fluxos de trabalho de agentes de codificação.
Ele se posiciona entre outros dois modelos da Poolside:
| Modelo | Parâmetros Totais | Parâmetros Ativados por Token | Janela de Contexto | Posicionamento |
|---|---|---|---|---|
| Laguna XS 2.1 | 33B | 3B | 256K | Codificação local mais rápida e de ciclo curto |
| Laguna S 2.1 | 118B | ~8B | 1M | Codificação de agente de ciclo longo mais forte |
| Laguna M.1 | 225B | 23B | 256K | Modelo maior para tarefas complexas de agente |
A Poolside afirma que o Laguna S 2.1 levou menos de nove semanas desde o início do treinamento até o lançamento. Ele é treinado na mesma série de dados de pré-treinamento do Laguna XS 2.1, alcançando melhorias de desempenho por meio de escalonamento, correções de código de treinamento, mudanças de receita e novos trabalhos de pós-treinamento.
A empresa descreve o S 2.1 como seu modelo atual mais forte para desenvolvimento de funcionalidades diárias, alterações em múltiplos arquivos, tarefas de terminal e sessões de codificação mais longas.
A ficha técnica oficial do modelo lista a seguinte arquitetura:
| Especificação | Laguna S 2.1 |
|---|---|
| Arquitetura | Modelo Misto de Especialistas |
| Parâmetros Totais | 118B |
| Parâmetros Ativados | ~8B por token |
| Número de Camadas | 48 |
| Camadas de Atenção Global | 12 |
| Camadas de Janela Deslizante | 36 |
| Tamanho da Janela Deslizante | 512 tokens |
| Número de Especialistas Roteados | 256 |
| Especialistas Selecionados | Top 10 |
| Especialistas Compartilhados | 1 |
| Janela de Contexto | 1.048.576 tokens |
| Modalidade | Entrada e saída de texto |
| Raciocínio | Raciocínio intercalado, controlável por requisição |
| Tamanho do Vocabulário | 100.352 tokens |
O modelo utiliza atenção de consulta agrupada e uma mistura de atenção global e de janela deslizante. A Poolside também fornece um modelo de rascunho DFlash treinado...
Quando a pilha de inferência oferece suporte, o modelo reduz a latência de serviço.
O Laguna S 2.1 contém 118 bilhões de parâmetros, mas nem todos são ativados a cada token.
Seu roteador seleciona uma parte dos especialistas para cada token, com aproximadamente 8 bilhões de parâmetros efetivamente participando do cálculo. Esta é a principal razão pela qual a Poolside afirma que o modelo é mais eficiente em comparação a modelos densos de porte similar.
Tabela de comparação simplificada:
| Modelo Denso | Modelo Misto de Especialistas |
|---|---|
| A maioria dos parâmetros participa por token | Apenas especialistas selecionados participam |
| Custo computacional cresce com o tamanho total | Custo computacional pode ser muito menor que o total |
| Comportamento de roteamento simples | Roteamento e serviço mais complexos |
| Memória depende dos pesos completos do modelo | Memória também depende dos pesos totais e da precisão escolhida |
Não confunda a vantagem de eficiência com uso reduzido de memória.
Mesmo que apenas 8 bilhões de parâmetros sejam ativados por token, o sistema ainda precisa acessar os pesos completos dos especialistas. Os arquivos GGUF oficiais mostram o tamanho real:
| Arquivo GGUF Oficial | Tamanho Aproximado |
|---|---|
| F16 | 235GB |
| Q8_0 | 128GB |
| Q4_K_M | 75GB |
| Modelo de Rascunho DFlash BF16 | 2.2GB |
A versão quantizada de 4 bits é mais gerenciável que o modelo de precisão total, mas 75GB ainda exigem uma estação de trabalho com memória unificada extremamente alta ou memória acelerada, além de espaço adicional para cache de contexto e tempo de execução.
O modelo base suporta um comprimento máximo de contexto de 1.048.576 tokens.
Para agentes de codificação, uma janela de contexto grande é útil nas seguintes tarefas:
O limite de um milhão de tokens não significa que cada solicitação deve preencher a janela inteira.
Contextos longos aumentam o uso de memória, o tempo de pré-preenchimento e o custo de serviço. Eles também podem introduzir informações irrelevantes, dificultando o trabalho do modelo. Bons frameworks de agentes de codificação ainda exigem funcionalidades de seleção de arquivos, recuperação, sumarização, cache e gerenciamento de contexto.
As plataformas de hospedagem podem expor limites de contexto inferiores ao suportado pelo modelo subjacente. O anúncio de lançamento da OpenCode afirma suportar 100 mil de contexto, mas antes de projetar fluxos de trabalho em torno do valor máximo, os usuários devem verificar as entradas atuais do modelo e as políticas do fornecedor. Endpoints gratuitos ou de pré-visualização podem ajustar os limites de contexto e a disponibilidade a qualquer momento.
O Laguna S 2.1 suporta modos com raciocínio ativado e sem raciocínio.
Em APIs de inferência compatíveis, o modo de raciocínio pode ser controlado por solicitação através da opção enable_thinking.
Os dois modos são adequados para diferentes tarefas:
Este modo é adequado para trabalhos que exigem planejamento e raciocínio intermediário, como:
O modo sem raciocínio é mais adequado para cenários como:
O modo de raciocínio não se aplica automaticamente a todas as tarefas. Ele geralmente consome mais tokens e leva mais tempo. As equipes devem avaliar ambos os modos em seus próprios repositórios e medir a eficácia pela taxa de conclusão de tarefas, em vez de confiar apenas na qualidade subjetiva da saída.
A Poolside divulgou os seguintes resultados para o Laguna S 2.1:
| Benchmark | Pontuação Relatada |
|---|---|
| Terminal-Bench 2.1 | 70,2% |
| SWE-Bench Multilíngue | 78,5% |
| SWE-Bench Pro (conjunto de dados público) | 59,4% |
| DeepSWE | 40,4% |
| SWE Atlas (Perguntas e Respostas sobre Código) | 46,2% |
| Toolathlon Verified | 49,7% |
A Poolside afirma que a maioria das pontuações é baseada na métrica pass@1 e calculada como a média de múltiplas execuções. Seu arquivo público de trajetórias mostra
Os resultados indicam que o Laguna S 2.1 é competitivo em comparação com diversos modelos de parâmetros totais maiores.
No entanto, é necessário interpretar as tabelas de benchmark com cautela.
Os resultados podem variar devido aos seguintes fatores:
A página do modelo Poolside explica que suas tabelas comparativas podem utilizar os dados mais elevados de modelos concorrentes, seja em relatórios de fornecedores, rankings de benchmark ou rankings de terceiros. Esse método é adequado para comparações macro, mas difere de testar todos os modelos sob uma configuração de avaliação uniforme.
A conclusão mais segura é: o Laguna S 2.1 apresenta um desempenho robusto em sua categoria de parâmetros efetivos. Equipes que selecionam modelos de codificação de nível profissional ainda devem testar com seus próprios conjuntos de problemas, repositórios de código, cadeias de ferramentas e critérios de revisão.
A Poolside lançou o Laguna S 2.1 sob a licença OpenMDW-1.1, uma licença de materiais de modelo mantida pelo projeto OpenMDW.
Esta licença concede aos usuários direitos amplos para usar, modificar e redistribuir os materiais do modelo gratuitamente, desde que cumpram os termos. A redistribuição deve reter a licença e as declarações de copyright ou fonte relacionadas.
Além disso, as saídas geradas pelo uso do modelo não estão sujeitas às restrições da licença.
Na prática, os desenvolvedores precisam distinguir os seguintes termos:
O Laguna S 2.1 se enquadra claramente como uma publicação de pesos abertos. A Poolside e a OpenCode estão comprometidas em promover o desenvolvimento e a aplicação da tecnologia de inteligência artificial.
Os materiais de lançamento utilizam uma terminologia mais forte de "código aberto", mas as organizações devem revisar o texto real da OpenMDW-1.1, as diretrizes de uso responsável da Poolside, as dependências de terceiros e seus próprios requisitos legais antes de redistribuir ou implantar comercialmente.
A licença também fornece os materiais do modelo "no estado em que se encontram", sem qualquer garantia. Os usuários continuam sendo responsáveis por testar a precisão, segurança, adequação e conformidade.
A OpenCode anunciou que, durante o período promocional, o Laguna S 2.1 pode ser usado gratuitamente através do OpenCode Zen, sem taxa de uso do modelo.
Isso oferece aos usuários uma maneira de baixo custo para testar, sem a necessidade de baixar arquivos de checkpoint de 75-235 GB ou executar hardware de inferência local.
A documentação do OpenCode destaca dois detalhes importantes:
Portanto, os usuários devem evitar enviar:
A prévia gratuita é adequada para repositórios de código público, projetos sintéticos e avaliação de baixo risco. O teste com código empresarial privado só deve ser feito após revisar as políticas de dados atuais, termos de retenção, controles de espaço de trabalho e opções pagas ou auto-hospedadas disponíveis na plataforma.
O OpenCode pode ser instalado através de seu instalador oficial:
curl -fsSL https://opencode.ai/install | bash
Após a instalação, conecte-se ao OpenCode Zen e selecione o modelo gratuito Laguna S 2.1 atualmente listado.
Descreva sua ideia uma vez e o We0 AI pode gerar um site de apresentacao, paginas e CMS, alem de ajudar a atrair clientes e trafego apos o lancamento.
Uma geração completa de projetos para registro gratuito
Melhor para experimentar um fluxo de geração completo e ver rapidamente um primeiro rascunho do projeto.
Durante a prévia, o nome exato do modelo, limite de contexto, limite de uso e disponibilidade podem mudar. Antes de iniciar tarefas de longa duração, verifique a documentação do OpenCode Zen e o seletor de modelos.
O cartão oficial do modelo no Hugging Face fornece o seguinte comando:
docker model run hf.co/poolside/Laguna-S-2.1
O tamanho do download necessário e a quantidade de memória dependem do formato escolhido em tempo de execução. Revise os arquivos do modelo antes de baixá-los para sua estação de trabalho ou servidor.
A Poolside fornece um repositório GGUF oficial e um fork do llama.cpp compatível com Laguna.
git clone --branch laguna https://github.com/poolsideai/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build -j
./build/bin/llama-server \
-hf poolside/Laguna-S-2.1-GGUF:Q4_K_M \
--jinja \
--port 8000
O arquivo Q4_K_M tem aproximadamente 75 GB. O sistema também precisará de memória para overhead de tempo de execução e cache KV, especialmente ao usar contextos longos.
As instruções oficiais incluem um modelo de rascunho DFlash opcional:
./build/bin/llama-server \
-m laguna-s-2.1-Q4_K_M.gguf \
-md laguna-s-2.1-DFlash-BF16.gguf \
--spec-type draft-dflash \
--spec-draft-n-max 15 \
-fa on \
--jinja \
--port 8000
A decodificação especulativa pode aumentar a velocidade de geração, mas os resultados específicos dependem de hardware, formato do prompt, comprimento do contexto, configuração de compilação e taxa de aceitação do modelo de rascunho.
A Poolside afirma que o Laguna S 2.1 é pequeno o suficiente para rodar em um único NVIDIA DGX Spark.
Isso é viável para um checkpoint quantizado adequado, pois o DGX Spark é projetado em torno de uma grande configuração de memória unificada. No entanto, isso não significa que todos os formatos de modelo, tamanhos de contexto ou modos de serviço se ajustarão imediatamente.
Os usuários devem fazer quatro perguntas separadamente:
Um modelo teoricamente carregável pode ser muito lento para codificação interativa em comprimentos de contexto extremos. Throughput, tempo para o primeiro token, consumo de energia e carga de trabalho concorrente precisam de medições independentes.
O relatório inicial do AIBase citou testes da comunidade usando um Apple M3 Max com 128 GB de memória unificada e o fork do llama.cpp da Poolside.
O checkpoint Q4_K_M de 75 GB torna tal implantação tecnicamente crível, mas a experiência variará muito devido a:
Relatos da comunidade não devem ser considerados recomendações de hardware confiáveis. Os desenvolvedores devem consultar os tamanhos oficiais de arquivo e deixar margem de memória suficiente antes de baixar o modelo.
O Laguna S 2.1 reflete várias mudanças mais amplas no campo de modelos de codificação.
Grandes parâmetros totais podem fornecer capacidade, enquanto a ativação esparsa ajuda a controlar a quantidade de computação por token.
Isto
A arquitetura MoE é mais atraente para agentes de codificação que podem executar por minutos ou horas.
Janelas de milhões de tokens já foram associadas principalmente a modelos proprietários hospedados. Seu surgimento em modelos de codificação de peso aberto dá às equipes mais controle sobre experimentos em repositórios longos e implantações privadas.
A Poolside treina seus modelos Laguna dentro de sua própria estrutura de agente e afirma que eles têm melhor desempenho nesse ambiente ou em outros clientes compatíveis com o Protocolo de Cliente de Agente (Agent Client Protocol).
Os benchmarks de codificação medem sistemas compostos por modelo mais agente, não apenas a capacidade bruta de previsão do próximo token. Uso de ferramentas, seleção de contexto, lógica de retry, acesso ao terminal e aplicação de patches impactam substancialmente o desempenho.
As organizações podem inspecionar os arquivos, escolher seu próprio runtime, quantizar o modelo, implantá-lo em infraestrutura privada e conectá-lo a agentes de codificação internos.
Essa flexibilidade é valiosa para ambientes que envolvem código-fonte com privacidade sensível e acesso à rede restrito.
O cartão oficial do modelo descreve o Laguna S 2.1 como um modelo texto-para-texto. Ele não é um modelo nativo de imagem, áudio ou vídeo.
Seu número de parâmetros ativos é relativamente pequeno, mas o modelo completo, os pesos completos ainda são grandes. Um laptop comum não será adequado para o formato oficial de alta qualidade.
A capacidade máxima de um milhão de tokens não equivale a um processamento eficiente de um milhão de tokens no uso diário. A latência de pré-preenchimento e a memória do cache KV podem se tornar bastante significativas.
Uma pontuação pública de destaque em programação não garante um bom desempenho na combinação de linguagens, sistema de construção, padrões de codificação ou estrutura privada de uma empresa.
A documentação do período gratuito do OpenCode indica que entradas e saídas coletadas podem ser usadas para melhoria do modelo. Código confidencial não deve ser submetido sem uma política aprovada.
Qualquer agente de programação, quando recebe amplas permissões, pode excluir arquivos, executar comandos, alterar dependências ou introduzir vulnerabilidades de segurança.
Uso:
O Laguna S 2.1 é mais adequado para:
Pode ser menos adequado para:
O Laguna S 2.1 é um modelo de Mistura de Especialistas (MoE) com 118 bilhões de parâmetros, projetado para programação de agentes e tarefas de engenharia de software de ciclo longo. Ativa cerca de 8 bilhões de parâmetros por token e suporta uma janela de contexto de até 1.048.576 tokens.
Seus pesos estão disponíveis publicamente sob a licença OpenMDW-1.1, portanto, "pesos abertos" é a descrição mais clara. Os usuários devem revisar o contrato de licença, a documentação do modelo, as diretrizes de uso aceitável e quaisquer componentes de terceiros antes de redistribuir ou implantar comercialmente.
O OpenCode atualmente oferece uma opção gratuita do Laguna S 2.1 por tempo limitado. Disponibilidade, limites de contexto, limites de taxa e termos de uso de dados podem mudar; portanto, verifique a documentação atual do OpenCode Zen antes de confiar nele.
O anúncio do OpenCode promoveu o contexto de um milhão, alinhado com a capacidade máxima do modelo base. Os endpoints hospedados podem impor limites diferentes, portanto, verifique a configuração do modelo ativada no OpenCode antes de enviar contextos muito longos.
Relatos da comunidade indicam que versões quantizadas podem ser executadas em sistemas Apple Silicon com alta memória, incluindo configurações M3 Max de 128 GB. O desempenho e o contexto disponível dependem do método de quantização, ambiente de runtime, memória disponível e carga do sistema.
A Poolside afirma que uma versão adequada pode ser executada em um único NVIDIA DGX Spark. O comprimento de contexto alcançável, a velocidade de tokens e a concorrência dependem do formato do checkpoint e da configuração de serviço.
A Poolside relata 70,2% no Terminal-Bench 2.1, 78,5% no SWE-Bench Multilíngue, 59,4% no conjunto de dados público SWE-Bench Pro e 40,4% no DeepSWE. Esses números devem ser avaliados juntamente com os métodos de teste da empresa e testes independentes.
Sim. O cartão oficial do modelo mostra que ele suporta raciocínio intercalado e permite que o raciocínio seja ativado ou desativado por solicitação em sistemas de serviço compatíveis.
Catálogo de modelos Poolside: Comparação oficial entre Laguna S 2.1, XS 2.1 e toda a família de modelos Laguna.
O Poolside Laguna S 2.1 possui 118B de parâmetros totais, aproximadamente 8B de parâmetros ativos por token, uma janela de contexto de um milhão de tokens, raciocínio controlável e pesos abertos oficialmente disponíveis em múltiplos formatos.
A Poolside reportou desempenho robusto em benchmarks de terminal e engenharia de software, incluindo 70,2% no Terminal-Bench 2.1 e 40,4% no DeepSWE. Esses resultados destacam o modelo em sua categoria de tamanho, embora as equipes devam replicar o desempenho em seus próprios repositórios e frameworks de agentes.
O acesso gratuito limitado do OpenCode facilita o teste do modelo, enquanto os pesos para download permitem implantação privada, porém com o custo de enormes requisitos de memória, mudanças nas políticas de serviços gerenciados e riscos operacionais para agentes de codificação autônomos.
O Laguna S 2.1 é um lançamento significativo de pesos abertos para tarefas de codificação de longa duração, mas seu verdadeiro valor dependerá da integração com agentes, eficiência de implantação e desempenho em trabalhos reais de desenvolvimento — e não apenas do rótulo de 1 milhão de tokens de contexto.
Comece com uma frase e tenha um site completo em minutos.