For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/pt/articles/meta-open-sources-muse-glimmer-30b.md.
A Meta lançou o Muse Glimmer, um modelo de pesos abertos com 30 bilhões de parâmetros, projetado para agentes de IA locais e residentes. O m...

A Meta lançou o Muse Glimmer, um modelo de pesos abertos com 30 bilhões de parâmetros, projetado especificamente para agentes de IA locais e executados de forma contínua.
O modelo foi apresentado pelo Meta Superintelligence Labs em 10 de agosto de 2026, e seus pesos estão disponíveis sob a licença permissiva Apache License 2.0.
O Muse Glimmer adota um paradigma de implantação diferente dos modelos de ponta centrados em nuvem que a maioria das pessoas usa hoje.
Em vez de enviar cada prompt, captura de tela, documento ou chamada de ferramenta para uma API de modelo hospedada, ele foi projetado para rodar diretamente em um Mac ou PC equipado com hardware de consumo adequado.
A Meta o posiciona para as seguintes tarefas:
O modelo aceita entrada de texto e imagem e gera saída de texto. Ele pode interpretar capturas de tela, gráficos, documentos e outras entradas visuais por meio de um codificador perceptivo dedicado.
Seus dados de treinamento abrangem mais de 100 idiomas.
A ideia central é simples:
Contexto pessoal
+ Modelo local
+ Ferramentas
+ Loop de agente de longa duração
=
Um assistente de IA que funciona sem depender de modelos em nuvem
Esse design local-primeiro é especialmente importante para agentes que podem precisar acessar dados pessoais, como arquivos, mensagens, calendário e documentos de trabalho.
No entanto, "modelo offline" não deve ser interpretado como "todas as tarefas de agente podem ser executadas offline". O Muse Glimmer em si pode operar sem conexão com a internet, mas agentes que acessam calendários na nuvem, enviam e-mails, pesquisam na web ou usam outros serviços remotos ainda exigirão conectividade e credenciais correspondentes.
O relatório inicial da AIBase descreveu o Glimmer como uma versão aberta do Muse Spark anterior da Meta.
Essa afirmação é próxima em espírito, mas tecnicamente imprecisa.
A descrição oficial da Meta afirma que o Muse Glimmer foi destilado do Muse Spark.
O modelo foi construído por meio de um pipeline de treinamento em múltiplas etapas, transferindo capacidades de um modelo professor maior para uma arquitetura menor, mais adequada a hardware local.
A Meta descreve três etapas principais de treinamento:
Portanto, a relação entre ambos pode ser melhor resumida como:
Muse Spark
↓
Saídas do professor e raciocínio
↓
Destilação + treinamento orientado a agentes
↓
Muse Glimmer 30B
O Glimmer não é simplesmente o mesmo checkpoint do Spark com pesos disponibilizados diretamente para download.
É um modelo independente e menor, otimizado em torno das restrições de inferência local.
A ficha técnica atual do modelo na Meta lista aproximadamente 29,6 bilhões de parâmetros totais, incluindo o codificador visual.
| Especificação | Muse Glimmer 30B |
|---|---|
| Arquitetura | Transformer causal denso com codificador perceptivo |
| Parâmetros totais | ~29,6B |
| Camadas do Transformer | 52 |
| Dimensão oculta | 6.656 |
| Atenção | Padrão repetido local/local/local/global |
| Janela deslizante | 2.048 |
| Comprimento do contexto | 131.072+ tokens |
| Codificador visual | ViT-G/14 com ~1,8B de parâmetros |
| Máx. tokens visuais por imagem | 4.096 |
| Entrada | Texto + imagem |
| Saída | Texto |
| Idiomas de treinamento | Dados em mais de 100 idiomas |
| Data de corte do conhecimento | 4 de janeiro de 2026 |
| Licença | Apache 2.0 |
O modelo é denso, não uma mistura de especialistas (MoE).
Isso torna a implantação local mais difícil, pois todos os pesos do modelo precisam ser carregados durante a inferência.
A Meta resolve isso principalmente por meio de quantização.
Em precisão total, um modelo desse porte exige mais memória do que as GPUs de consumo típicas podem oferecer.
A Meta afirma que o modelo em precisão total exige mais de 55 GB de memória, com uma referência de precisão total de 64 GB de VRAM.
Para implantação local, a Meta oferece variantes quantizadas de aproximadamente 4 bits.
A comparação oficial é a seguinte:
| Variante | Hardware alvo | Queda média de precisão* |
|---|---|---|
| Precisão total | 64 GB VRAM | — |
| K-Quant-Dynamic | 32 GB VRAM | 0,2% |
| K-Quant-17GB | 24 GB VRAM | 1,0% |
*A Meta relata a queda como a média dos indicadores de precisão em 15 benchmarks comuns.
Os pesos do modelo comprimido podem ser reduzidos para menos de 20 GB, deixando espaço para:
Essa mudança de engenharia tornou viável executar localmente um agente multimodal denso de 30B em um dispositivo de consumo de alta qualidade.
"Hardware de consumo" ainda precisa de contextualização.
Em comparação com clusters de data centers, a exigência de 24 GB ou 32 GB de memória é alcançável, mas não se trata de uma configuração de notebook básico.
O modelo completo ainda é exigente.
O Muse Glimmer não é posicionado principalmente como um modelo de chat leve.
A Meta o treinou e avaliou em torno da conclusão de tarefas de agente.
Várias capacidades relacionadas são destacadas na ficha técnica do modelo.
O Glimmer foi projetado para concluir tarefas inteiras, não para parar após uma única resposta.
O agente pode:
Entender o objetivo
→ Criar um plano
→ Chamar ferramentas
→ Verificar resultados
→ Revisar o plano
→ Chamar outra ferramenta
→ Concluir a tarefa
Isso é especialmente útil em cenários onde a resposta correta depende de operações intermediárias.
O modelo foi treinado para chamar funções usando padrões estruturados em fluxos de trabalho estendidos.
Isso o torna adequado para sistemas que expõem ferramentas como:
O modelo em si não obtém acesso automático a esses sistemas.
O scaffolding do agente determina quais ferramentas existem e quais permissões o modelo recebe.
O Glimmer suporta planejamento contínuo em fluxos de trabalho mais longos.
Ele também suporta quatro níveis de intensidade de raciocínio:
Baixo
Médio
Alto
Muito alto
A Meta recomenda os níveis "alto" ou "muito alto" para tarefas mais difíceis de codificação, raciocínio e agentes.
Níveis mais baixos podem ser mais adequados quando a latência é mais importante que o raciocínio profundo.
Uma das características mais importantes de um agente é a capacidade de continuar operando após uma chamada de ferramenta falhar.
A Meta afirma que o Glimmer foi treinado para diagnosticar resultados inesperados e tentar novamente, em vez de parar imediatamente.
Para um assistente local de longa duração, isso é tão importante quanto o desempenho bruto em benchmarks.
Ferramentas reais falham.
Arquivos são movidos. Comandos retornam erros. APIs expiram. Programas podem não compilar.
Um agente que não se recupera transforma cada pequena falha em uma interrupção que exige intervenção humana.
O Muse Glimmer inclui um codificador visual dedicado com aproximadamente 1,8 bilhão de parâmetros.
Isso permite processar entradas intercaladas de texto e imagem.
A Meta destaca especialmente casos de uso envolvendo:
Isto é especialmente importante para agentes inteligentes de operação de computador.
Agentes locais podem inspecionar capturas de tela de aplicativos e usar esse contexto visual no próximo raciocínio.
A Ollama fornece os seguintes exemplos:
Vídeo não é um modal de entrada otimizado nativamente.
O modelo card da Meta mostra que vídeo pode ser processado como quadros separados, mas o modelo não é explicitamente otimizado para compreensão de vídeo.
Entrada e saída de áudio também não são suportadas.
A AIBase relatou que o Glimmer suporta interações de texto e imagem, com dados de treinamento cobrindo mais de 100 idiomas.
O modelo card da Meta confirma que seus dados de treinamento vêm de mais de 100 idiomas.
Isso não equivale a garantir o mesmo desempenho em todos os idiomas.
A Meta afirma explicitamente que o modelo não foi avaliado em todos os idiomas de seus dados de pré-treinamento, e o desempenho pode ser mais fraco fora dos idiomas principais suportados.
Para aplicativos multilíngues locais, os desenvolvedores devem testar diretamente o idioma-alvo, em vez de assumir qualidade uniforme.
Fluxos de trabalho de agentes locais podem parecer lentos, pois uma única tarefa pode exigir várias rodadas de raciocínio e chamadas de ferramentas.
Pequenas penalidades de latência repetidas ao longo de 20 ou 50 etapas do agente tornam-se perceptíveis.
O Muse Glimmer vem com um modelo companheiro leve de decodificação especulativa baseado em DFlash.
O modelo rascunho propõe um bloco de tokens futuros.
Em seguida, o modelo principal Glimmer valida esses tokens propostos em paralelo.
O fluxo simplificado é o seguinte:
DFlash elabora um bloco
→ Muse Glimmer valida
→ Tokens corretos são aceitos
→ Tokens incorretos são corrigidos
A Meta afirma que o modelo DFlash pode elaborar blocos de 16 tokens por propagação direta.
O objetivo é reduzir o gargalo sequencial do processo comum de geração token por token.
A Meta relatou velocidades de decodificação com seu modelo K-Quant-17GB combinado com o modelo rascunho DFlash quantizado:
| Dispositivo | Linha de base | Com DFlash | Aceleração relatada |
|---|---|---|---|
| NVIDIA RTX 5090 | 74,9 tok/s | 233,4 tok/s | 3,1× |
|
| Apple M5 Max | 26,6 tok/s | 50,2 tok/s | 1,8× |
| Apple M4 Max | 23,7 tok/s | 37,8 tok/s | 1,5× |
Acima estão as medições relatadas pela Meta.
A empresa afirma que os testes usaram decodificação gulosa com tamanho de lote 1, as medições no M4/M5 foram feitas via ExecuTorch, e as medições na RTX 5090 via llama.cpp.
A velocidade em aplicações reais variará de acordo com:
A Meta comparou o Muse Glimmer com outros modelos de peso aberto de tamanho semelhante, incluindo Gemma4-31B e Qwen3.6-27B.
Alguns resultados relatados pela empresa incluem:
| Benchmark | Muse Glimmer 30B |
|---|---|
| MCP Atlas | 75,5 |
| DeepSearch QA | 74,6 |
| WildClawBench | 47,6 |
| OSWorld-Verified | 65,9 |
| SWE-Bench Pro | 51,2 |
| SWE-Bench Verified | 76,0 |
| TerminalBench 2.1 | 51,7 |
| ScreenSpot Pro | 75,4 |
| MMMU Pro | 74,0 |
| AIME 2026 | 94,7 |
| GPQA Diamond | 83,5 |
O desempenho geral é competitivo, mas não lidera em todas as frentes.
Por exemplo, os próprios gráficos da Meta mostram que, em vários benchmarks, outros modelos superam o Glimmer.
Isso é esperado.
O principal posicionamento de produto do Muse Glimmer não é "obter os melhores resultados em todos os benchmarks".
Mas sim a combinação dos seguintes elementos:
Capacidades de agente
+
Entrada multimodal
+
Execução local
+
Pesos abertos
+
Foco em memória de nível consumidor
A Meta também publicou um documento separado de metodologia de avaliação.
O documento afirma que os dados de comparação podem vir de uma mistura das seguintes fontes:
Benchmarks de agentes são particularmente sensíveis aos seguintes fatores:
Tabelas de benchmarks são evidências úteis.
Mas não devem ser vistas como prova de que determinado modelo é ótimo em todos os cenários reais de implantação de agentes.
O texto original foca na privacidade pessoal.
Este também é um dos motivos mais importantes para executar agentes localmente.
Um agente pessoal útil pode precisar acessar:
Enviar todo esse material para um serviço de modelo remoto forma um padrão de fluxo de dados completamente diferente de processar no dispositivo do usuário.
O design do Muse Glimmer permite que o ciclo central de raciocínio permaneça local.
O documento oficial de receitas do Muse Glimmer da Meta afirma que sua receita local-first pode ser executada sem:
Isso pode reduzir a quantidade de dados pessoais que precisam sair do dispositivo.
Essa distinção continua importante.
Um modelo local pode se conectar a ferramentas que enviam dados para outros lugares.
Por exemplo:
Modelo Glimmer local
→ Serviço de e-mail em nuvem
→ Calendário remoto
→ Busca na web
→ Servidores MCP de terceiros
Nesse sistema, o raciocínio do modelo é local, mas o fluxo de trabalho não é totalmente offline.
A privacidade depende da arquitetura completa do agente.
Os desenvolvedores devem auditar:
Inferência local é uma primitiva de privacidade útil, não uma garantia universal.
Para fluxos de trabalho construídos inteiramente em torno de recursos locais, o Muse Glimmer pode continuar operando quando não há conexão com a internet.
Um agente pessoal local pode, em tese, lidar com as seguintes tarefas:
É exatamente isso que a Meta quer dizer ao descrever o Glimmer como um modelo de agente local sempre ativo.
O modelo permanece disponível sem precisar aguardar endpoints na nuvem.
Isso também elimina taxas de API por token após o usuário já ter pago pelo hardware e pela eletricidade.
Descreva sua ideia uma vez e o We0 AI pode gerar um site de apresentacao, paginas e CMS, alem de ajudar a atrair clientes e trafego apos o lancamento.
Uma geração completa de projetos para registro gratuito
Melhor para experimentar um fluxo de geração completo e ver rapidamente um primeiro rascunho do projeto.
Baixar o Muse Glimmer não cria automaticamente um assistente pessoal completo.
O modelo é apenas um componente.
Um agente útil ainda precisa de um ambiente de execução.
Componentes típicos incluem:
Muse Glimmer
+
Instruções do sistema
+
Definições de ferramentas
+
Loop do agente
+
Controle de permissões
+
Memória
+
Aplicativos locais ou remotos
O modelo card da Meta indica que o Glimmer pode ser usado com padrões de orquestração de agentes como OpenClaw e Hermes Agent.
A Meta também lançou o Muse Glimmer
Manual de culinária, abrangendo:
Isso torna este lançamento mais valioso do que apenas disponibilizar pesos.
O Ollama adicionou suporte antecipado ao Muse Glimmer em 10 de agosto.
No momento em que este texto foi escrito, as notas de versão do próprio Ollama afirmam que o suporte inicial é feito por meio do mecanismo MLX no Apple Silicon.
Espera-se que mais otimizações sejam lançadas posteriormente para Apple Silicon, NVIDIA, AMD e outras plataformas.
Instale a versão atual do Ollama e execute:
ollama run muse-glimmer:30b-mlx
Para integrações suportadas de agentes de codificação, a documentação do Ollama fornece exemplos, como:
ollama launch claude --model muse-glimmer:30b-mlx
Para OpenClaw:
ollama launch openclaw --model muse-glimmer:30b-mlx
Para Hermes:
ollama launch hermes --model muse-glimmer:30b-mlx
Como o suporte de runtime local está evoluindo rapidamente após o lançamento de novos modelos, consulte a documentação mais recente do Ollama antes de assumir os mesmos rótulos de modelo e suporte de backend no Windows, Linux, NVIDIA ou AMD.
A página atual do modelo no Hugging Face oferece um guia de início rápido com vLLM.
Instale o vLLM:
pip install vllm
Sirva o Muse Glimmer:
vllm serve "meta-models/Muse-Glimmer-30B"
O servidor gerado expõe uma API compatível com OpenAI.
Isso pode facilitar a conexão de aplicativos que já sabem como chamar endpoints locais de chat no estilo OpenAI.
A memória necessária para servir em precisão total é muito maior do que as versões quantizadas de 24 GB/32 GB.
Caminhos de implantação.
Escolha os artefatos do modelo e o runtime com base no hardware realmente disponível.
A página oficial do modelo também oferece o caminho SGLang:
pip install sglang
Depois:
python3 -m sglang.launch_server \
--model-path "meta-models/Muse-Glimmer-30B" \
--host 0.0.0.0 \
--port 30000
Em seguida, o modelo pode ser chamado pelo endpoint compatível com OpenAI do servidor local.
A página atual de integração do Hugging Face também lista:
docker model run hf.co/meta-models/Muse-Glimmer-30B
A implantação baseada em Docker pode simplificar o empacotamento, mas a compatibilidade de hardware, os requisitos de memória e o suporte de runtime ainda precisam ser validados na máquina de destino.
A coleção do Meta no Hugging Face atualmente inclui vários artefatos oficiais:
O model card do Meta mostra que este lançamento inclui:
Todos publicados sob licença Apache 2.0.
Isso é muito mais amigável para desenvolvedores do que lançar apenas um grande checkpoint de pesquisa.
Codificação é um dos casos de uso mais claros para agentes locais.
Agentes de codificação normalmente precisam acessar:
Manter esses materiais localmente pode ser atraente para cenários como:
A Meta avaliou o Glimmer em tarefas de codificação, como SWE-Bench e TerminalBench, e listou agentes de codificação como um dos casos de uso esperados.
Ainda assim, a implantação local não elimina os riscos comuns de agentes de codificação.
Um modelo com permissão de shell ou escrita de arquivos pode:
Controle de permissões e isolamento em sandbox continuam sendo essenciais.
O model card da Meta não descreve o Glimmer como um sistema autônomo que deve receber acesso ilimitado.
Ele sugere implantar o modelo como parte de um sistema mais amplo, com medidas de proteção adequadas ao contexto.
Para usos agênticos, a Meta recomenda explicitamente implementar controles como confirmação humana para ações irreversíveis.
Isso é especialmente importante para tarefas que envolvem:
Modelos locais podem reduzir a dependência da nuvem, mas o design cuidadoso do agente continua necessário.
A Meta afirma que a capacidade geral do Muse Glimmer é inferior à do Muse Spark e, portanto, não atinge a definição de IA avançada do Meta
no AI Framework de expansão avançada do Meta.
Ainda assim, a Meta avaliou este lançamento de código aberto por meio de seu processo de Preparedness.
O model card fornece as seguintes classificações:
| Área de risco | Avaliação da Meta |
|---|---|
| Químico/Biológico | Médio-baixo ou inferior |
| Segurança cibernética | Médio-baixo ou inferior (inferido) |
| Perda de controle | Médio-baixo ou inferior (inferido) |
A Meta afirma que as conclusões sobre segurança cibernética e perda de controle são inferidas, em parte porque o Glimmer é, no geral, mais fraco que o Muse Spark 1.0, que obteve as mesmas classificações nessas áreas.
Estas são avaliações de segurança da própria Meta, não certificações independentes.
A empresa também reconhece que os testes não podem cobrir todos os cenários.
A parte final do artigo da AIBase conecta o Muse Glimmer à ideia de superinteligência pessoal de Mark Zuckerberg.
Essa conexão é oficial.
A Meta repetidamente posicionou seus modelos e produtos recentes da seguinte forma: IA avançada deve ajudar indivíduos a buscar seus próprios objetivos, em vez de concentrar inteligência nas mãos de poucas empresas ou governos.
No artigo de Zuckerberg de 10 de agosto, "O futuro pertence a todos", ele defende que a IA avançada deve ser amplamente distribuída.
Os cenários que ele listou em que agentes pessoais podem ajudar incluem:
Ele também afirmou que a Meta pretende disponibilizar essas ferramentas gratuitamente ou pelo menor preço possível, incluindo versões gratuitas para bilhões de pessoas.
O Muse Glimmer é uma demonstração prática de parte dessa filosofia:
Modelo de agente poderoso
→ pesos baixáveis
→ inferência local
→
Hardware controlado pelo usuário
O argumento de Zuckerberg vai além da conveniência para desenvolvedores.
Ele vê a IA de código aberto como uma forma de reduzir a concentração de poder.
A lógica é:
Poucas instituições controlam a IA mais forte
→ A inteligência torna-se concentrada
Muitas pessoas podem executar modelos poderosos
→ As capacidades tornam-se mais distribuídas
Se isso leva a melhores resultados de segurança é uma questão controversa.
Zuckerberg acredita que o acesso amplo pode criar freios e contrapesos.
Outros argumentam que modelos de código aberto de alta capacidade também podem aumentar os riscos de abuso, porque certas salvaguardas são difíceis de aplicar quando os pesos são amplamente distribuídos.
O fato de o Muse Glimmer não ser o modelo mais capaz da Meta é crucial neste debate.
As próprias avaliações de Preparedness da Meta indicam que o Glimmer é claramente mais fraco que o Muse Spark e o classificam como médio-baixo ou inferior nas principais categorias de risco de fronteira.
Isso o torna um ponto de entrada de risco relativamente baixo para implementar uma estratégia local/de código aberto.
O artigo da AIBase apresenta uma dicotomia simples:
Muse Glimmer = código aberto
Muse Spark = código fechado
Isso descreve com precisão parte do estado atual dos produtos da Meta, mas é estático demais como estratégia de longo prazo.
O Muse Spark foi inicialmente lançado por meio do Meta AI e de uma prévia da API privada, em vez de pesos para download.
O Glimmer tem pesos abertos.
No entanto, a 10ª declaração de Zuckerberg em agosto também afirmou que, com o super laboratório de IA da Meta em operação, a Meta retomará a publicação de alguns modelos de código aberto.
A cobertura contemporânea do mesmo anúncio também mencionou que a Meta planeja lançar mais versões do Muse com pesos abertos.
Portanto, a compreensão mais precisa é:
A Meta está adotando diferentes modos de acesso para diferentes níveis de capacidade e produtos, enquanto se compromete publicamente a continuar com lançamentos abertos no futuro.
Concluir que a Meta decidiu que seus modelos Muse mais fortes permanecerão fechados permanentemente é uma afirmação exagerada.
IA em nuvem tem vantagens claras:
IA local oferece outro conjunto de vantagens:
O Muse Glimmer é digno de atenção porque tenta trazer capacidades poderosas de agente para o lado local desse equilíbrio.
Seu objetivo não é um pequeno assistente que responde a algumas perguntas predefinidas.
Mas sim um modelo capaz de:
É aqui que reside a importância do alvo de implantação de 24GB/32GB.
Ele leva capacidades de agente para dispositivos que desenvolvedores individuais e usuários avançados realmente podem possuir.
| Declaração | Status atual |
|---|---|
| Meta lançou o Muse Glimmer em 10 de agosto de 2026 | Confirmado |
| O modelo tem aproximadamente 30 bilhões de parâmetros | Confirmado |
| Os pesos do modelo foram lançados sob licença Apache 2.0 | Confirmado |
| Glimmer foi destilado do Muse Spark | Confirmado |
| Glimmer é exatamente o mesmo modelo Muse Spark de código aberto | Não |
| O modelo aceita entradas de texto e imagem | Confirmado |
| Ele gera saídas de texto | Confirmado |
| Foi treinado com dados em mais de 100 idiomas | Confirmado |
| Comprimento do contexto de 131.072+ tokens | Confirmado |
| Versões quantizadas para ambientes de 24GB e 32GB de memória | Confirmado |
| Pode ser executado em Mac ou PC com hardware de consumo adequado | Confirmado pela Meta |
| Pode ser executado localmente sem infraestrutura em nuvem ou conexão com a internet | Confirmado para o modelo em si |
| Todas as tarefas de agente podem ser concluídas offline | Não; ferramentas de rede ainda exigem conexão |
| Aceleração de decodificação DFlash | Confirmado |
| Meta relatou aceleração de até 3,1x na RTX 5090 | Alegação da empresa |
| Muse Glimmer é voltado para agentes locais e codificação | Confirmado |
| Gerencia automaticamente e-mail, calendário e arquivos após download | Não; requer framework de agente e permissões de ferramentas |
| Muse Spark permanecerá fechado permanentemente | Não confirmado |
| Zuckerberg quer superinteligência pessoal amplamente disponível e acessível | Confirmado |
O Muse Glimmer é um modelo multimodal de pesos abertos com aproximadamente 30 bilhões de parâmetros do super laboratório de IA da Meta. Ele é otimizado para fluxos de trabalho de agentes locais, uso de ferramentas, codificação, compreensão de capturas de tela, raciocínio de contexto longo e tarefas de múltiplas etapas.
Concluído.
A Meta lançou os pesos do modelo e artefatos relacionados sob a licença permissiva Apache 2.0 e descreveu o lançamento como código aberto/pesos abertos. Em termos de precisão técnica, ele geralmente é descrito como um modelo de pesos abertos, pois o principal artefato lançado é o modelo treinado.
As versões quantizadas oficiais da Meta têm como alvo 32GB de VRAM para K-Quant-Dynamic e 24GB de VRAM para K-Quant-17GB. O modelo de precisão total requer mais de 55GB de memória, com configuração alvo de 64GB mostrada na ficha técnica do modelo da Meta.
Sim. O modelo pode realizar inferência localmente sem modelo em nuvem ou conexão com a internet. No entanto, se o agente usar pesquisa na web, e-mail em nuvem, calendário remoto, bancos de dados online ou outras ferramentas da internet, a execução dessas chamadas de ferramenta ainda exigirá conexão com a rede.
Sim. Ele vem equipado com um codificador perceptivo dedicado de aproximadamente 1,8B parâmetros que aceita entradas de texto e imagem. Ele pode realizar análise de raciocínio sobre capturas de tela, gráficos, documentos e outros conteúdos visuais.
Sim. O Ollama já adicionou suporte inicial para o Muse Glimmer em seu mecanismo MLX para Apple Silicon. No lançamento, o Ollama afirmou que mais otimizações e suporte de plataforma virão posteriormente, então usuários de outros hardwares devem verificar as notas de versão mais recentes.
Não exatamente. O Muse Glimmer foi destilado do Muse Spark e treinado como um modelo independente de 30B, voltado para cargas de trabalho de agentes locais. Ele herda capacidades do modelo professor maior, mas não é simplesmente um checkpoint do Spark com uma licença aberta.
DFlash é um modelo companheiro de decodificação especulativa que propõe blocos de tokens futuros para o modelo principal validar em paralelo. A Meta relatou que, em suas configurações de teste, o DFlash acelerou a velocidade de decodificação em 1,5x no M4 Max, 1,8x no M5 Max e 3,1x na RTX 5090.
/blog/muse-glimmer): Durante a execução local do modelo, oferece suporte antecipado ao Muse Glimmer e integração com agentes.
Quantização.
O Muse Glimmer é um novo modelo de pesos abertos de 30B lançado pelo Meta Superintelligence Labs, voltado para agentes de IA locais e residentes. Ele é destilado do Muse Spark, em vez de ser uma cópia direta de código aberto do Spark, e integra entrada multimodal, chamada de ferramentas, codificação, raciocínio de contexto longo, recuperação de falhas e suporte a mais de 100 idiomas de treinamento.
O foco de engenharia está na implantação local. A Meta oferece configurações de quantização projetadas para ambientes com 24GB e 32GB de memória, janelas de contexto de 128K+ e um modelo companheiro de decodificação especulativa chamado DFlash, que, segundo a empresa, pode acelerar significativamente a geração.
A execução local dá aos desenvolvedores mais controle sobre arquivos privados e contexto pessoal, ao mesmo tempo que reduz a dependência de inferência hospedada. Mas isso não torna automaticamente todos os fluxos de trabalho conectados a agentes privados ou offline; e-mail remoto, calendários, navegadores, MCP e outros serviços ainda geram seus próprios fluxos de dados.
Este lançamento também está alinhado com a estratégia mais ampla de superinteligência pessoal da Meta. Zuckerberg acredita que a IA avançada deve ser amplamente distribuída, gratuita ou a preços acessíveis, e cada vez mais controlada por indivíduos, em vez de concentrada nas mãos de poucas instituições.
O significado do Muse Glimmer não está em um modelo de 30B substituir os maiores modelos em nuvem, mas em capacidades sérias de agentes multimodais estarem chegando a hardware que desenvolvedores individuais e usuários avançados podem possuir e controlar.
Comece com uma frase e tenha um site completo em minutos.