Poolside Apresenta Laguna S 2.1, Modelo de Codificação Compacto que Supera Gigantes da IA

Poolside Apresenta Laguna S 2.1, Modelo de Codificação Compacto que Supera Gigantes da IA
A Poolside lançou o Laguna S 2.1, seu terceiro modelo de IA de codificação em apenas três meses. Focado em persistência e verificação, este modelo compacto de 8 bilhões de parâmetros ativos tem demonstrado desempenho superior a rivais significativamente maiores em benchmarks, chegando a resolver um problema matemático de longa data.
Poolside Lança Laguna S 2.1 com Foco em Persistência
A empresa Poolside, sediada nos EUA, acaba de lançar o Laguna S 2.1, seu terceiro modelo de inteligência artificial voltado para codificação em apenas três meses. Este modelo, que utiliza 8 bilhões de parâmetros ativos em uma arquitetura de mistura de especialistas (MoE), prioriza não a escala bruta, mas sim um comportamento aprimorado durante sessões agênticas longas. A Poolside afirma que o Laguna S 2.1 supera outros modelos de codificação agênticos em sua classe de peso e, em alguns casos, se aproxima de sistemas 10 a 20 vezes maiores. O modelo possui 118 bilhões de parâmetros totais e suporta janelas de contexto de até um milhão de tokens, oferecendo modos de 'pensamento' e 'não-pensamento'.
Desempenho Notável em Benchmarks Exigentes
Com o modo de 'pensamento' habilitado, o Laguna S 2.1 alcança uma pontuação de 70.2% no Terminal-Bench 2.1, um teste que avalia modelos em tarefas de terminal de longa duração. Esse resultado o posiciona logo atrás do Hy3 da Tencent (295B-A21B) e à frente de modelos abertos consideravelmente maiores, como o DeepSeek-V4-Pro-Max, Nemotron 3 Ultra e o modelo de estreia do Thinking Machines Lab. O modelo também se destaca no benchmark DeepSWE da Datacurve, onde atinge 40.4%, superando modelos de código aberto com mais de um trilhão de parâmetros que ficam abaixo de 10%. Além disso, o Laguna S 2.1 figura entre os melhores em sua classe nos testes SWE-Bench Multilingual, SWE-Bench Pro e SWE Atlas.
A importância do modo de 'pensamento' é evidente: sem ele, a pontuação do Laguna S 2.1 no Terminal-Bench cai para 60.4%, e no DeepSWE para 16.5%. A Poolside observa que nenhum modelo Laguna anterior demonstrou uma lacuna de desempenho tão significativa entre os dois modos.
A Persistência como Alternativa à Escalada Bruta
A Poolside argumenta que o lançamento reflete uma nova visão sobre o desempenho de modelos de IA.
Fonte: The Decoder



Comentarios
Troque ideia com outros leitores, responda em contexto e mantenha a conversa útil.
Faça login para comentar
Entre com sua conta Google para participar da discussão com nome e avatar.
Os comentários já publicados continuam visíveis mesmo sem login.