Poolside a publié Laguna S 2.1 , son modèle de codage le plus puissant actuellement disponible publiquement.

Poolside a publié Laguna S 2.1, son modèle de codage le plus puissant actuellement disponible publiquement.
Ce modèle est conçu pour le génie logiciel agentique et les tâches de longue durée. Il compte 118 milliards de paramètres au total, active environ 8 milliards de paramètres par jeton, et prend en charge une fenêtre de contexte allant jusqu'à 1 048 576 jetons, aussi bien en mode réflexion qu'en mode non-réflexion.
Poolside a publié les poids du modèle sous la licence OpenMDW-1.1. L'entreprise propose également plusieurs formats officiels de points de contrôle et de quantification via Hugging Face, tandis qu'OpenCode en propose une version hébergée gratuitement pour une durée limitée.
Ces détails font de Laguna S 2.1 une version exceptionnelle. Il vise à offrir des performances agentiques de codage robustes sans que chaque jeton doive traverser l'intégralité du réseau de 118 milliards de paramètres, et peut être déployé en privé par des équipes disposant de matériel suffisamment puissant.
Parallèlement, plusieurs déclarations entourant cette publication doivent être replacées dans leur contexte. Les scores des benchmarks sont principalement rapportés par Poolside, tous les fournisseurs d'hébergement n'exposent pas la capacité complète d'un million de jetons, et le fait d'être « assez petit pour fonctionner sur un DGX Spark » ne signifie pas que le modèle peut tourner confortablement sur un ordinateur portable développeur standard.

Laguna S 2.1 est un modèle de base texte-texte, spécifiquement entraîné pour le génie logiciel, les tâches terminales, l'utilisation d'outils et les flux de travail agentiques de codage.
Il se situe entre les deux autres modèles de Poolside :
| Modèle | Paramètres totaux | Paramètres activés par jeton | Fenêtre de contexte | Positionnement |
|---|---|---|---|---|
| Laguna XS 2.1 | 33B | 3B | 256K | Codage local plus rapide et à cycle court |
| Laguna S 2.1 | 118B | ~8B | 1M | Codage agentique plus fort pour cycles longs |
| Laguna M.1 | 225B | 23B | 256K | Modèle plus grand pour tâches agentiques complexes |
Poolside indique que Laguna S 2.1 est passé de l'entraînement à la publication en moins de neuf semaines. Il est entraîné sur la même série de données de pré-entraînement que Laguna XS 2.1, avec des améliorations de performance obtenues via la mise à l'échelle, des corrections de code d'entraînement, des modifications de recettes et un nouveau travail post-entraînement.
L'entreprise décrit S 2.1 comme son modèle actuel le plus fort pour le développement quotidien de fonctionnalités, les modifications multi-fichiers, les tâches terminales et les sessions de codage plus longues.
La fiche technique officielle répertorie l'architecture suivante :
| Spécification | Laguna S 2.1 |
|---|---|
| Architecture | Modèle mixte d'experts |
| Paramètres totaux | 118B |
| Paramètres activés | ~8B par jeton |
| Nombre de couches | 48 |
| Couches d'attention globale | 12 |
| Couches à fenêtre glissante | 36 |
| Taille de la fenêtre glissante | 512 jetons |
| Nombre d'experts routés | 256 |
| Experts sélectionnés | Top 10 |
| Nombre d'experts partagés | 1 |
| Fenêtre de contexte | 1 048 576 jetons |
| Modalité | Entrée texte et sortie texte |
| Inférence | Réflexion entrelacée, contrôlable par requête |
| Taille du vocabulaire | 100 352 jetons |
Le modèle utilise l'attention par requêtes groupées et un mélange d'attention globale et d'attention à fenêtre glissante. Poolside fournit également un modèle d'ébauche DFlash entraîné...
Ce modèle réduit la latence de service lorsque la pile d'inférence le prend en charge.
Laguna S 2.1 contient 118 milliards de paramètres, mais tous ne sont pas activés pour chaque jeton.
Son routeur sélectionne une partie des experts pour chaque jeton, et environ 8 milliards de paramètres participent effectivement au calcul. C'est la principale raison pour laquelle Poolside affirme que ce modèle est plus efficace qu'un modèle dense de taille comparable.
Tableau comparatif simplifié :
| Modèle dense | Modèle mixte d'experts |
|---|---|
| La plupart des paramètres participent à chaque jeton | Seuls les experts sélectionnés participent |
| La charge de calcul augmente avec la taille totale | La charge de calcul peut être bien inférieure à la taille totale |
| Comportement de routage simple | Routage et service plus complexes |
| La mémoire dépend des poids complets du modèle | La mémoire dépend également des poids complets et de la précision choisie |
Ne confondez pas l'avantage en efficacité avec une faible empreinte mémoire.
Même si seulement 8 milliards de paramètres sont activés par jeton, le système doit accéder aux poids complets des experts. Les fichiers GGUF officiels montrent l'échelle réelle :
| Fichier GGUF officiel | Taille approximative |
|---|---|
| F16 | 235 Go |
| Q8_0 | 128 Go |
| Q4_K_M | 75 Go |
| Modèle d'ébauche DFlash BF16 | 2,2 Go |
La version quantifiée à quatre bits est plus gérable que le modèle en pleine précision, mais 75 Go nécessitent toujours une station de travail avec une mémoire unifiée très élevée ou une mémoire accélérée, plus de l'espace supplémentaire pour le cache de contexte et l'exécution.
Le modèle de base prend en charge une longueur de contexte maximale de 1 048 576 jetons.
Pour les agents de codage, une grande fenêtre de contexte est utile pour les tâches suivantes :
La limite d'un million de jetons ne signifie pas que chaque requête doit remplir toute la fenêtre.
Un contexte long augmente l'utilisation de la mémoire, le temps de pré-remplissage et le coût de service. Il peut également introduire des informations non pertinentes, rendant le travail du modèle plus difficile. Un bon framework d'agent de codage nécessite toujours la sélection de fichiers, la récupération, le résumé, la mise en cache et la gestion du contexte.
Les plateformes d'hébergement peuvent exposer des limites de contexte inférieures à la capacité sous-jacente du modèle. L'annonce de la publication d'OpenCode revendique une prise en charge du contexte d'un million, mais avant de concevoir des flux de travail autour de cette valeur maximale, les utilisateurs doivent consulter les entrées actuelles du modèle et les politiques des fournisseurs. Les points de terminaison gratuits ou d'aperçu peuvent ajuster les limites de contexte et la disponibilité à tout moment.
Laguna S 2.1 prend en charge à la fois l'inférence avec réflexion activée et sans réflexion.
Dans les API d'inférence prises en charge, le mode d'inférence peut être contrôlé par requête via l'option enable_thinking.
Les deux modes conviennent à différentes tâches :
Ce mode est adapté aux tâches nécessitant une planification et un raisonnement intermédiaire, par exemple :
Le mode non-réflexion est plus adapté aux scénarios suivants :
Le mode d'inférence ne s'applique pas automatiquement à toutes les tâches. Il consomme généralement plus de jetons et prend plus de temps. Les équipes doivent évaluer les deux modes sur leur propre dépôt de code et mesurer l'efficacité via le taux d'achèvement des tâches, plutôt que de se fier uniquement à la qualité subjective de la sortie.
Poolside a publié les résultats des tests de Laguna S 2.1 comme suit :
| Benchmark | Score rapporté |
|---|---|
| Terminal-Bench 2.1 | 70,2 % |
| SWE-Bench version multilingue | 78,5 % |
| SWE-Bench Pro (ensemble de données public) | 59,4 % |
| DeepSWE | 40,4 % |
| SWE Atlas (questions-réponses sur le code source) | 46,2 % |
| Toolathlon Verified | 49,7 % |
Poolside indique que la plupart des scores sont basés sur la métrique pass@1 et sont moyennés sur plusieurs tests. Son archive publique de trajectoires
Les résultats montrent que Laguna S 2.1 est compétitif face à des modèles au nombre total de paramètres plus élevé.
Il convient toutefois d'interpréter les tableaux de référence avec prudence.
Les résultats peuvent varier en fonction des facteurs suivants :
La page du modèle Poolside précise que ses tableaux comparatifs peuvent utiliser les données les plus élevées des modèles concurrents, issues des rapports des fournisseurs, des classements de référence ou des classements tiers. Cette approche convient à une comparaison macro, mais diffère d'un test de tous les modèles sous une configuration d'évaluation unifiée.
La conclusion la plus sûre est la suivante : Laguna S 2.1 affiche de solides performances dans sa catégorie de paramètres efficaces. Les équipes qui choisissent un modèle de codage de production doivent toujours tester avec leurs propres ensembles de problèmes, dépôts de code, chaînes d'outils et critères d'examen.
Poolside a publié Laguna S 2.1 sous la licence OpenMDW-1.1, une licence de matériel de modèle maintenue par le projet OpenMDW.
Cette licence accorde aux utilisateurs des droits étendus pour utiliser, modifier et redistribuer gratuitement le matériel du modèle, sous réserve du respect des conditions. Toute redistribution doit conserver la licence et les mentions de droit d'auteur ou de source associées.
De plus, les résultats produits par l'utilisation du modèle ne sont pas soumis aux restrictions de la licence.
En pratique, les développeurs doivent distinguer les termes suivants :
Laguna S 2.1 relève clairement d'une publication de poids ouverts. Poolside et OpenCode s'engagent ensemble à promouvoir le développement et l'application des technologies d'intelligence artificielle.
Les supports de publication utilisent une formulation plus forte d'« open source », mais les organisations doivent examiner le texte réel d'OpenMDW-1.1, les directives d'utilisation responsable de Poolside, les dépendances tierces et leurs propres exigences légales avant toute redistribution ou déploiement commercial.
Cette licence fournit également le matériel du modèle « en l'état », sans aucune garantie. Les utilisateurs restent responsables des tests de précision, de sécurité, d'adéquation et de conformité.
OpenCode annonce que, pendant la période de promotion, Laguna S 2.1 est accessible gratuitement via OpenCode Zen, sans frais d'utilisation du modèle.
Cela offre aux utilisateurs un moyen peu coûteux de tester le modèle sans télécharger les fichiers de point de contrôle de 75 à 235 Go ni utiliser de matériel d'inférence local.
La documentation d'OpenCode souligne deux détails importants :
Par conséquent, les utilisateurs doivent éviter d'envoyer :
L'aperçu gratuit est adapté aux dépôts de code publics, aux projets synthétiques et aux évaluations à faible risque. Le test avec du code d'entreprise privé ne doit être effectué qu'après avoir examiné la politique actuelle de données de la plateforme, les conditions de conservation, les contrôles de l'espace de travail et les options payantes ou auto-hébergées disponibles.
OpenCode peut être installé via son installateur officiel :
curl -fsSL https://opencode.ai/install | bash
Une fois l'installation terminée, connectez-vous à OpenCode Zen et sélectionnez le modèle gratuit Laguna S 2.1 actuellement répertorié.
Pendant la période d'aperçu, le nom exact du modèle, la limite de contexte, les limites d'utilisation et la disponibilité peuvent changer. Avant de lancer des tâches de longue durée, veuillez consulter la documentation d'OpenCode Zen et le sélecteur de modèle.
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
La fiche officielle du modèle Hugging Face fournit la commande suivante :
docker model run hf.co/poolside/Laguna-S-2.1
La taille de téléchargement et la mémoire requises dépendent du format choisi lors de l'exécution. Veuillez consulter les fichiers du modèle avant de les télécharger sur votre poste de travail ou serveur.
Poolside fournit un dépôt GGUF officiel et une branche llama.cpp compatible avec Laguna.
git clone --branch laguna https://github.com/poolsideai/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build -j
./build/bin/llama-server \
-hf poolside/Laguna-S-2.1-GGUF:Q4_K_M \
--jinja \
--port 8000
La taille du fichier Q4_K_M est d'environ 75 Go. Le système nécessite également de la mémoire pour les frais généraux d'exécution et le cache KV, en particulier lors de l'utilisation de longs contextes.
Les instructions officielles incluent un modèle de brouillon DFlash optionnel :
./build/bin/llama-server \
-m laguna-s-2.1-Q4_K_M.gguf \
-md laguna-s-2.1-DFlash-BF16.gguf \
--spec-type draft-dflash \
--spec-draft-n-max 15 \
-fa on \
--jinja \
--port 8000
Le décodage spéculatif peut améliorer la vitesse de génération, mais les résultats dépendent du matériel, de la forme de l'invite, de la longueur du contexte, de la configuration de construction, etc.
de la configuration et du taux d'acceptation du modèle de brouillon.
Poolside affirme que Laguna S 2.1 est suffisamment petit pour fonctionner sur un seul NVIDIA DGX Spark.
C'est réalisable pour un point de contrôle quantifié approprié, car le DGX Spark est conçu autour d'une grande configuration de mémoire unifiée. Cela ne signifie pas que chaque format de modèle, taille de contexte ou mode de service s'adaptera immédiatement.
Les utilisateurs doivent se poser quatre questions distinctes :
Un modèle théoriquement chargeable peut encore être trop lent pour le codage interactif avec des longueurs de contexte extrêmes. Le débit, le temps de génération du premier jeton, la consommation d'énergie et les charges de travail simultanées nécessitent des mesures séparées.
Le rapport initial d'AIBase cite des tests communautaires, utilisant un système Apple M3 Max avec 128 Go de mémoire unifiée et la branche llama.cpp de Poolside.
Le point de contrôle Q4_K_M de 75 Go rend ce type de déploiement techniquement crédible, mais l'expérience varie considérablement en fonction de :
Les rapports communautaires ne doivent pas être considérés comme des recommandations matérielles fiables. Les développeurs doivent se référer aux tailles de fichiers officielles et prévoir une marge mémoire suffisante avant de télécharger le modèle.
Laguna S 2.1 reflète plusieurs évolutions plus larges dans le domaine des modèles de codage.
Un nombre total de paramètres élevé peut offrir de la capacité, tandis que l'activation sparse aide à contrôler la quantité de calcul par jeton.
Cela
L'architecture MoE est particulièrement attrayante pour les agents de codage qui peuvent fonctionner pendant plusieurs minutes ou heures.
Les fenêtres contextuelles de plusieurs millions de tokens étaient principalement associées aux modèles propriétaires hébergés. Leur apparition dans les modèles de codage à poids ouverts offre aux équipes davantage de contrôle sur les expériences avec de longs référentiels et les déploiements privés.
Poolside entraîne ses modèles Laguna dans son propre framework d'agents et indique qu'ils offrent les meilleures performances dans cet environnement ou dans des clients compatibles avec le protocole client agent (Agent Client Protocol).
Les benchmarks de codage mesurent la performance du système composé du modèle et de l'agent, et non uniquement la capacité de prédiction du prochain token. L'utilisation d'outils, la sélection du contexte, la logique de réessai, l'accès au terminal et l'application de correctifs influencent considérablement les performances.
Les organisations peuvent inspecter les fichiers, choisir leur propre environnement d'exécution, quantifier le modèle, le déployer sur une infrastructure privée et le connecter à leur agent de codage interne.
Cette flexibilité est précieuse pour les environnements où la confidentialité du code source est sensible et l'accès au réseau est restreint.
La fiche officielle du modèle décrit Laguna S 2.1 comme un modèle texte-texte. Il n'est pas un modèle natif pour les images, l'audio ou la vidéo.
Son nombre de paramètres actifs est relativement faible, mais le modèle complet, avec tous ses poids, est toujours volumineux. Un ordinateur portable standard ne conviendra pas au format officiel de haute qualité.
Une capacité maximale d'un million de tokens ne signifie pas un traitement efficace d'un million de tokens en usage quotidien. La latence de préremplissage et la mémoire du cache KV peuvent devenir considérables.
Un score public élevé en programmation ne garantit pas d'excellentes performances sur la combinaison linguistique, le système de construction, les normes de codage ou le framework privé d'une entreprise.
La documentation de la période gratuite d'OpenCode indique que les entrées et sorties collectées peuvent être utilisées pour l'amélioration du modèle. Aucun code confidentiel ne doit être soumis sans politique approuvée.
Tout agent de codage disposant d'autorisations étendues peut supprimer des fichiers, exécuter des commandes, modifier des dépendances ou introduire des vulnérabilités de sécurité.
Utilisations :
Laguna S 2.1 est le plus adapté pour :
Il est probablement moins adapté pour :
Laguna S 2.1 est un modèle de mélange d'experts de 118 milliards de paramètres, conçu pour le codage agentique et les tâches d'ingénierie logicielle à long cycle. Il active environ 8 milliards de paramètres par token et prend en charge une fenêtre de contexte allant jusqu'à 1 048 576 tokens.
Ses poids sont disponibles publiquement sous la licence OpenMDW-1.1, donc « poids ouverts » est la description la plus claire. Les utilisateurs doivent examiner l'accord de licence, la documentation du modèle, les directives d'utilisation acceptable et tout composant tiers avant de le redistribuer ou de le déployer commercialement.
OpenCode propose actuellement une option gratuite pour Laguna S 2.1 pour une durée limitée. La disponibilité, les limites de contexte, les limites de débit et les conditions d'utilisation des données peuvent changer. Vérifiez donc la documentation actuelle d'OpenCode Zen avant de vous y fier.
L'annonce d'OpenCode fait la promotion d'un contexte d'un million de tokens, conforme à la capacité maximale du modèle de base. Les points de terminaison hébergés peuvent imposer des limites différentes. Vérifiez donc la configuration du modèle activé dans OpenCode avant d'envoyer des contextes très longs.
Des rapports de la communauté indiquent que des versions quantifiées peuvent fonctionner sur des systèmes Apple Silicon à haute mémoire, y compris les configurations M3 Max avec 128 Go. Les performances et le contexte utilisable dépendent de la quantification, de l'environnement d'exécution, de la mémoire disponible et de la charge du système.
Poolside indique qu'une version appropriée peut fonctionner sur un seul NVIDIA DGX Spark. La longueur de contexte réalisable, la vitesse des tokens et la concurrence dépendent du format du point de contrôle et de la configuration du service.
Poolside rapporte 70,2 % sur Terminal-Bench 2.1, 78,5 % sur SWE-Bench Multilingual, 59,4 % sur l'ensemble de données public SWE-Bench Pro et 40,4 % sur DeepSWE. Ces données doivent être évaluées en tenant compte de la méthodologie de test de l'entreprise et de tests indépendants.
Oui. La fiche officielle du modèle montre qu'il prend en charge le raisonnement entrelacé et permet d'activer ou de désactiver le raisonnement par requête dans les systèmes de service compatibles.
Modèles Poolside : Comparaison officielle entre Laguna S 2.1, XS 2.1 et l'ensemble de la famille Laguna.
Poolside Laguna S 2.1 dispose de 118B paramètres au total, environ 8B paramètres actifs par token, une fenêtre de contexte d'un million de tokens, un raisonnement contrôlable, et publie officiellement les poids dans plusieurs formats.
Poolside rapporte des performances solides sur les benchmarks terminaux et génie logiciel, notamment 70,2 % sur Terminal-Bench 2.1 et 40,4 % sur DeepSWE. Ces résultats placent le modèle parmi les meilleurs de sa catégorie, mais les équipes devraient reproduire ces performances sur leurs propres dépôts et frameworks d'agents.
L'accès limité gratuit d'OpenCode permet de tester facilement le modèle, tandis que les poids téléchargeables
rendent possible un déploiement privé, mais au prix d'exigences mémoire élevées, de changements de politique des services d'hébergement, et de risques opérationnels pour les agents de codage autonomes.
Laguna S 2.1 constitue une publication significative de poids open source pour les tâches de codage longues, mais sa véritable valeur dépendra de l'intégration des agents, de l'efficacité du déploiement et de ses performances dans des travaux de développement réels — bien au-delà de l'étiquette « 1 million de tokens de contexte ».
Partez d’une phrase et obtenez un site complet en quelques minutes.