For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/pt/articles/robobrain-orca-multimodal-world-model.md.
O RoboBrain Orca explora uma mudança de prever saídas isoladas para modelar transições de estado do mundo. Em vez de tratar linguagem, image...

Os sistemas de IA modernos já conseguem fazer muitas coisas impressionantes. Um modelo de linguagem pode responder perguntas e escrever código. Um modelo de imagem ou vídeo pode gerar conteúdo visual realista. Um modelo robótico pode aprender a agarrar, colocar ou mover objetos.
Mas essas capacidades muitas vezes vêm de alvos de previsão separados. Um modelo de linguagem prevê o próximo token. Um modelo de vídeo prevê o próximo quadro. Uma política robótica prevê a próxima ação. Cada alvo é útil, mas ainda deixa uma questão mais profunda: o modelo entende como o próprio mundo muda?
O projeto RoboBrain Orca da BAAI, apresentado no relatório técnico "Orca: The World is in Your Mind," explora esse problema da perspectiva da representação mundial. Orca não é posicionado como apenas um chatbot mais forte, um gerador de imagens mais bonito ou uma política direta de aprendizado por imitação para robôs. Sua ideia central é mais fundamental: primeiro aprender uma representação latente compartilhada dos estados mundiais, depois ler essa representação para compreensão de linguagem, previsão de imagem e geração de ação.
O artigo original parte de uma observação simples, mas importante: a IA pode gerar saídas, mas a geração de saídas não é o mesmo que compreensão do mundo.
Por exemplo:
Essas questões apontam para um objetivo mais amplo. Um modelo mundial útil não deve apenas prever uma saída externa. Deve construir uma representação interna do estado mundial e da transição de estado.
A página do projeto e o relatório técnico do Orca descrevem isso como uma mudança de Previsão do Próximo X para Previsão do Próximo Estado. Em vez de prever separadamente o próximo token, próximo quadro ou próxima ação, o Orca tenta aprender como um estado mundial evolui sob dinâmicas naturais, condições de eventos e intenções de tarefa.
Página inicial do projeto: https://orca-wm.github.io
Relatório técnico: https://arxiv.org/abs/2606.30534
Após o lançamento, o Orca atraiu atenção de comunidades de pesquisa interessadas em modelos mundiais, representação multimodal e inteligência incorporada. A discussão focou menos em se o Orca pode gerar saídas visualmente atraentes, e mais em sua tentativa de conectar texto, imagens, vídeo e ação como diferentes projeções do mesmo mundo subjacente.

Nos últimos anos, muitos avanços em IA podem ser descritos como formas de "predizer o próximo X".
Os modelos de linguagem predizem o próximo token, o que lhes confere habilidades de escrita, raciocínio, diálogo e codificação. Os modelos de vídeo predizem ou sintetizam quadros futuros, o que os ajuda a criar movimentos mais coerentes. Os modelos incorporados frequentemente predizem a próxima ação, permitindo que robôs realizem tarefas de manipulação.
A Orca argumenta que isso não é suficiente para agentes que devem operar no mundo real. Linguagem, imagens e ações são apenas interfaces diferentes para o mundo. O alvo mais profundo é o próprio estado do mundo.
No enquadramento da Orca, a Predição do Próximo Estado significa aprender uma representação interna do estado que possa suportar transições física e semanticamente consistentes. Esse estado não é idêntico a uma frase, uma imagem ou uma trajetória de ação. Ele está mais próximo de uma representação latente comprimida do mundo.
Uma vez que tal representação é aprendida, diferentes módulos de leitura podem usá-la de diferentes maneiras:

É por isso que o projeto usa a frase "O Mundo está em Sua Mente." O mundo não é tratado como tokens, quadros e rótulos de ação desconectados. Ele é modelado como um espaço latente que pode ser lido através de múltiplas modalidades.
Se um robô é comparado a uma criança, muitas abordagens atuais são como enviar a criança diretamente para uma bancada de trabalho e pedir que repita uma tarefa específica até que se torne boa nessa tarefa.
A Orca segue uma ordem diferente. Antes de ensinar exatamente como um robô deve agir, ela tenta dar ao modelo uma educação mais geral sobre as mudanças no mundo.
Isso inclui regularidades básicas, como:
A motivação é direta. Se um modelo primeiro aprende como os estados do mundo mudam, então uma quantidade menor
de dados de ação pode ser suficiente para conectar essa representação ao controle do robô. Isso pode reduzir o custo de treinamento e melhorar a generalização.
O Orca utiliza dois modos de aprendizagem complementares: aprendizagem inconsciente e aprendizagem consciente.
A aprendizagem inconsciente captura transições naturais densas a partir de observações contínuas. O modelo observa como cenas, objetos, oclusão, contato e movimento evoluem sem precisar de rótulos de ação ou instruções explícitas de tarefas.
A aprendizagem consciente adiciona estrutura semântica. Ela usa descrições de eventos, linguagem e supervisão no estilo VQA para que o modelo possa conectar mudanças visuais com conceitos humanos, instruções e significado causal.
Juntos, esses modos de aprendizagem são suportados por três tipos principais de sinais.

O primeiro sinal é o vídeo contínuo do mundo real. Isso fornece ao modelo uma experiência densa de mudanças de estado naturais, como movimento de objetos, evolução de cenas, efeitos de contato e oclusão.
Este tipo de aprendizagem não exige que o modelo saiba o objetivo da tarefa antecipadamente. É mais próximo da observação passiva: o modelo aprende como o mundo muda ao observar o mundo mudar.
O segundo sinal é a organização em nível de evento. Processos do mundo real não são apenas quadros isolados. As pessoas naturalmente os descrevem como eventos: lavar legumes antes de cortá-los, abrir uma torneira antes que a água mude o estado dos alimentos, ou mover uma mão antes que um objeto mude de posição.
A supervisão de eventos ajuda o Orca a aprender transições de estado significativas sob condições semânticas específicas.
O terceiro sinal é a compreensão baseada em linguagem. A linguagem não é o objetivo final do Orca, mas é uma interface importante entre os estados do mundo e a intenção humana.
A supervisão de VQA ajuda a alinhar estados visuais, estrutura de eventos e linguagem natural. Em outras palavras, o modelo não deve apenas notar que algo mudou, mas também descrever e raciocinar sobre por que a mudança é importante.

Para suportar a aprendizagem de estados do mundo, o Orca utiliza um inventário de dados de aprendizagem do mundo em grande escala. O artigo original e a página oficial do projeto descrevem os seguintes recursos.
| Tipo de Recurso | Escala | Papel na Aprendizagem |
|---|---|---|
| Vídeo contínuo | Cerca de 125 mil horas | Observação densa de transições de estado natural |
| Anotações de eventos | Cerca de 160 milhões de eventos | Supervisão semântica para |
transições de estado significativas |
| Exemplos de VQA | Cerca de 11,5 milhões de exemplos | Alinhamento de linguagem e compreensão de estado condicionada a perguntas |
Essas fontes de dados abrangem interação egocêntrica, manipulação exocêntrica, vídeos de execução robótica, cenas dinâmicas naturais, transições no nível de eventos e resposta geral a perguntas visuais.
O ponto importante é que o Orca não é treinado apenas em trajetórias de robôs ou apenas em resposta a perguntas visuais. Ele tenta aprender um espaço latente mundial mais amplo a partir de vários tipos de sinais do mundo real.
Uma representação do mundo só é útil se puder ser testada e melhorada. Os experimentos do Orca, portanto, fazem duas perguntas centrais.
Os resultados de escala sugerem que, à medida que os dados de pré-treinamento aumentam, a perda continua diminuindo tanto para o modelo de 0,8B quanto para o de 4B. O modelo de 4B também atinge um nível de perda menor do que o modelo de 0,8B.

Isso apoia a ideia de que a previsão do próximo estado não é apenas um truque de pequena escala. Parece ser um objetivo de aprendizado de mundo escalável, pelo menos dentro da faixa testada.
O teste chave não é se o Orca pode inventar um conceito de som agradável. O teste é se o latente aprendido pode dar suporte a tarefas downstream reais.
O Orca congela a espinha dorsal pré-treinada e anexa módulos de leitura leves para três direções:

Esse design é importante porque a espinha dorsal congelada impede que os módulos downstream simplesmente reaprendam tudo do zero. Se diferentes leituras podem extrair habilidades de linguagem, imagem e ação do mesmo latente congelado, então a própria representação latente provavelmente carrega informações úteis sobre o estado do mundo.
Os resultados downstream também melhoram à medida que o pré-treinamento escala.

com/cms-assets/image/2026/07/28b12759-9160-48b4-92f6-6c6194bf0621-09-eb93bffa-9db9-456a-bfa9-cd10764544ba.png)
Em tarefas de geração de texto e VQA, o Orca é comparado com vários modelos de linguagem visual e modelos de mundo, incluindo V-JEPA, Emu3, Qwen3.5, Gemma, MiniCPM-V e DeepSeek-VL2.
Os resultados relatados mostram que o modelo de 4B do Orca apresenta desempenho forte entre modelos de tamanho semelhante, especialmente em perguntas que envolvem raciocínio temporal, transição de estado e movimento dinâmico.
Descreva sua ideia uma vez e o We0 AI pode gerar um site de apresentacao, paginas e CMS, alem de ajudar a atrair clientes e trafego apos o lancamento.
Uma geração completa de projetos para registro gratuito
Melhor para experimentar um fluxo de geração completo e ver rapidamente um primeiro rascunho do projeto.

Uma divisão simplificada das capacidades do artigo é mostrada abaixo.
| Dimensão de Capacidade | Qwen3.5-4B | Orca-4B | Vantagem do Orca |
|---|---|---|---|
| Transição de estado | 51.86 | 64.13 | +12.27% |
| Raciocínio de senso comum | 57.76 | 62.95 | +5.19% |
| Relações espaciais | 54.68 | 55.25 | +0.57% |
| Movimento dinâmico | 57.03 | 65.55 | +8.52% |

Esse padrão é importante. A vantagem do Orca não é apenas sobre reconhecer objetos em uma cena estática. Os maiores ganhos aparecem em categorias mais próximas da dinâmica do mundo: como um estado muda, como os eventos se desenrolam e como o movimento afeta a cena.
Para um modelo de mundo, isso é mais significativo do que a compreensão comum de imagens isoladamente. O mundo real não é uma coleção de imagens estáticas. É um sistema em mudança.
A leitura de imagem do Orca não é apresentada como um recurso padrão de geração de imagens. É usada como uma forma de testar se o modelo pode prever um estado visual futuro plausível após uma interação.
Isso difere da geração de imagens comum. Um gerador de imagens típico pode criar algo visualmente atraente, mas ainda assim violar as restrições reais da cena. Ele pode adicionar objetos que não estavam lá, remover a corporificação do robô, ignorar a instrução ou seguir um estereótipo em vez do estado atual.
Por exemplo, se uma instrução menciona um balão vermelho, um gerador normal pode desenhar um balão vermelho completamente inflado, independentemente do estado real do balão. Um preditor de estado mundial deve, em vez disso, raciocinar a partir da cena atual e da condição de interação.
No benchmark de interação no mundo real PRICE, o Orca é avaliado contra bases de geração de imagens como FLUX e OmniGen2. O objetivo não é apenas a qualidade visual, mas se o estado futuro previsto respeita o layout da cena, as relações entre objetos, a corporificação do robô e as restrições físicas.

Nesse contexto, a previsão de imagens torna-se uma sonda visível da compreensão do mundo. A questão não é "O modelo consegue desenhar uma imagem bonita?" A questão é "O modelo sabe o que esta cena deve se tornar após a interação descrita?"
Um dos experimentos mais interessantes do Orca é a leitura de ação para robôs reais.
Durante o pré-treinamento, o Orca não usa trajetórias de robôs rotuladas com ações. Ele não memoriza primeiro como um braço específico deve se mover. Em vez disso, ele aprende mudanças de estado do mundo a partir de vídeos, eventos e linguagem.
Para tarefas de ação downstream, os pesquisadores congelam a espinha dorsal do Orca e anexam um Expert de Ação estilo DiT treinado do zero. Cada tarefa usa uma pequena quantidade de dados de trajetória no domínio, e o modelo é então avaliado em configurações de manipulação de braço duplo fora da distribuição.

A comparação de geração de ação relatada mostra que o Orca melhora o avanço geral da tarefa e o comportamento de recuperação em comparação com várias linhas de base.

Uma comparação geral simplificada é mostrada abaixo.
| Modelo | Rule-based ↑ | M25 ↑ | M50 ↑ | SR ↑ | MaxP-F ↑ | FNS ↑ | DRR ↑ | SQS ↑ |
|---|---|---|---|---|---|---|---|---|
| V-JEPA 2.1 | 17.0 | 27 | 7 | 0 | 17.4 | 10.1 | 20.5 | 0.0 |
| Qwen3.5 | 10.5 | 18 | 5 | 0 | 13.1 | 7.6 | 11.9 | 0.0 |
| π₀.₅ | 29.4 | 54 | 14 | 5 | 26.5 | 15.3 | 26.7 | 3.0 |
| Orca | 32.4 | 55 | 14 | 6 | 27.9 | 15.1 | 30.3 | 2.9 |
Os exemplos de recuperação são especialmente relevantes. Em robótica real, a primeira tentativa muitas vezes falha. Um sistema que apenas mapeia observações para ações memorizadas pode travar após uma perturbação. Um sistema com representação de estado do mundo mais forte tem mais chances de perceber que a tarefa não está concluída, o objeto ainda existe e o estado atual ainda tem um caminho para o objetivo.

Este é o valor prático de aprender o estado do mundo.
antes da ação. A Orca não argumenta que os dados de ação são desnecessários. Em vez disso, ela altera a ordem de aprendizado: primeiro, aprende a dinâmica escalável do mundo; depois, conecta essa representação à ação do robô com uma quantidade menor de dados específicos da tarefa.
O artigo também discute experimentos de ablação. Os pesquisadores removem diferentes objetivos de treinamento e observam como as leituras de texto, imagem e ação mudam.
O resultado é que os três objetivos desempenham papéis diferentes.

A principal lição é que uma representação do mundo não é produzida por um único sinal de supervisão. Ela é moldada por múltiplas restrições: mudança natural, eventos semânticos, raciocínio de linguagem e transição de estado.
O artigo também menciona melhorias no treinamento em nível de sistema com base no framework FlagScale da BAAI. A equipe relata atualizações em torno de FSDP2, perda de entropia cruzada em partes e pré-busca direta/retroativa.
Em um cluster H100, essas mudanças supostamente aumentam o rendimento do treinamento da linha de base do StarVLA de 0,66 amostras/s/GPU para 2,91 amostras/s/GPU, uma aceleração de 4,4x.
Esta parte é importante porque o treinamento do modelo mundial depende fortemente da escala. Se o sistema de treinamento não puder lidar eficientemente com grandes pipelines de supervisão de vídeo, eventos e multimodais, a ideia de modelagem se torna difícil de testar na prática.
A Orca ainda é uma versão inicial. O relatório técnico e os materiais do projeto descrevem várias limitações.
A Orca atual depende principalmente de sinais visuais e de linguagem. Ela ainda não cobre totalmente toque, força, som, propriocepção e outras modalidades físicas que seriam importantes para uma modelagem mundial mais rica. A abordagem atual também ainda depende parcialmente de codificadores visuais existentes e espaços de representação multimodal.
A escala do modelo e dos dados são iniciais em comparação com a ambição de longo prazo de modelos mundiais fundamentais gerais. A previsão de imagens, a generalização de ações e os métodos de avaliação para modelagem mundial também precisam de mais trabalho.
Ainda assim, o valor da Orca não está em afirmar que a modelagem mundial está resolvida. Seu valor é que ela oferece um caminho concreto:
útil.
Se essa direção continuar a melhorar, poderá ter impacto além da robótica. Muitos domínios envolvem estado, intervenção e transição: sistemas físicos, biologia, modelagem ambiental, experimentos científicos e tomada de decisão autônoma.
A questão maior é se os futuros sistemas de IA podem primeiro construir um modelo interno, estável e transferível do mundo antes de gerar respostas, imagens ou ações.
Essa é a ideia central por trás do Orca: O Mundo Está em Sua Mente.
O BAAI RoboBrain Orca é um projeto inicial de modelo fundamental do mundo, focado na previsão do próximo estado. Ele aprende uma representação latente do mundo a partir de sinais multimodais e usa módulos de leitura leves para linguagem, previsão de imagens e geração de ações.
Previsão do Próximo Estado significa prever como o estado subjacente do mundo muda, não apenas prever o próximo token, quadro ou ação. O objetivo é modelar transições de estado de uma forma que possa apoiar raciocínio, previsão visual e controle incorporado.
O Orca não se limita a uma dessas categorias. Ele primeiro aprende um latente compartilhado do mundo e depois usa diferentes leituras para linguagem, visão e ação. É por isso que é descrito como um modelo mundial multimodal, em vez de um modelo de propósito único.
O Orca usa recursos de aprendizado mundial em grande escala, incluindo cerca de 125 mil horas de vídeo, 160 milhões de anotações de eventos e 11,5 milhões de exemplos de VQA. Esses sinais ajudam o modelo a aprender dinâmicas naturais, transições condicionadas a eventos e compreensão alinhada à linguagem.
Congelar a espinha dorsal torna a avaliação mais limpa. Se módulos de leitura leves podem ter um bom desempenho enquanto a espinha dorsal permanece congelada, isso sugere que a informação útil já está presente no latente do mundo aprendido, em vez de ser reaprendida do zero downstream.
Nos experimentos de ação relatados, o latente do mundo congelado do Orca é conectado a um especialista em ação treinável para tarefas robóticas. Não é simplesmente um controlador robótico plug-and-play direto, mas os resultados sugerem que o pré-treinamento de estado mundial pode ajudar na generalização downstream de robótica.
Os materiais disponíveis apresentam o Orca como uma direção de pesquisa inicial, não como um sistema de produção finalizado. O projeto ainda precisa de modalidades físicas mais amplas, métodos de avaliação mais fortes, treinamento em maior escala e pontos de verificação ou código de inferência disponibilizados para uma reprodução mais ampla.
Os melhores pontos de partida são a página oficial do projeto Orca, o relatório técnico do arXiv, o repositório do GitHub e a página do artigo no Hugging Face. Essas fontes fornecem as referências mais diretas para o design do modelo, dados, avaliação e citação.
figuras e futuros lançamentos de código ou pontos de verificação.
O RoboBrain Orca explora uma mudança de prever saídas isoladas para modelar transições de estado do mundo. Em vez de tratar linguagem, imagens e ações como alvos separados, ele tenta aprender uma representação de mundo latente compartilhada que possa suportar múltiplas interfaces de leitura.
O artigo explica a configuração de aprendizado do Orca, incluindo vídeo contínuo, anotações de eventos e dados VQA. Também percorre as três principais leituras: raciocínio textual, previsão de imagem de estado futuro e geração de ação robótica.
A ideia mais importante não é que o Orca completou a modelagem do mundo. É que o Orca oferece um caminho testável para construir e avaliar um modelo de mundo latente através de linguagem, visão e ação.
Em resumo: Orca é uma tentativa inicial de fazer a IA entender a mudança de estado antes de gerar palavras, imagens ou ações.
Comece com uma frase e tenha um site completo em minutos.