For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/de/articles/dexmal-dm05-embodied-foundation-model.md.
DM0.5 ist Dexmals neuestes verkörpertes Fundamentmodell, das auf größeren Datenmengen, einer 4B-Parameter-Architektur, längerem Gedächtnis, ...

Verkörperte KI hat keinen Mangel an beeindruckenden Demonstrationen, neuer Roboter-Hardware oder Forschungstalenten. Das schwierigere Problem bleibt jedoch dasselbe: Wie baut man eine Daten-Flywheel, die Roboter in realen Aufgaben kontinuierlich verbessern kann?
Dexmal, auf Chinesisch als 原力灵机 bekannt, stellte auf seiner Entwicklerveranstaltung ein neues verkörpertes Basismodell namens DM0.5 vor. Das Modell wird als ein Allzweck-Basismodell für verkörperte Intelligenz in offenen Welten positioniert. Es soll drei Dinge verbinden, die in der Robotik oft getrennt bleiben: groß angelegte Roboterdaten, Modellgeneralisierung und Bereitstellungsinfrastruktur.
Laut dem ursprünglichen QbitAI-Bericht basiert DM0.5 auf 150.000 Stunden Daten, verwendet ein 4B-Parameter-Modell und ist darauf ausgelegt, Navigation, Greifen, Ganzkörpersteuerung, Langzeitgedächtnis und Cross-Embodiment-Bereitstellung zu unterstützen.
Dexmal beschreibt DM0.5 mit drei Schlüsselwörtern: größer, stärker und praktischer.
Das Modell ist als allgemeines verkörpertes Basismodell für Aufgaben in offenen Welten positioniert. Im Vergleich zum vorherigen DM0-Modell verdoppelt DM0.5 den Parameterumfang auf 4B Parameter und erhöht das Trainingsdatenvolumen um 400%.
Die 150.000-Stunden-Datengrundlage besteht hauptsächlich aus drei Arten hochwertiger Daten.
DM0.5 verwendet 50.000 Stunden hochpräziser Roboter-Betriebsdaten. Diese Daten decken mehr als 100 Arten von Aktionen ab und unterstützen eine feinkörnige Ausrichtung zwischen Anweisungen und Aktionen auf Sekundenebene.
Dieser Teil des Datensatzes hilft dem Modell zu lernen, wie physikalische Aktionen tatsächlich in der realen Welt ausgeführt werden, nicht nur, wie sie in der Sprache beschrieben werden.
Das Modell verwendet auch 100.000 Stunden egozentrische Daten. Dies gibt dem Modell eine menschenähnlichere Sicht auf die Umgebung und unterstützt die Erzeugung hochpräziser 3D-Landmarken auf Millimeterebene.
Ich-Perspektive-Daten sind wichtig, weil Roboter Szenen aus der Perspektive eines Akteurs verstehen müssen, der sich durch die Welt bewegt, nicht nur aus statischen Kamerablickwinkeln.
Dexmal verwendet auch Szenenrekonstruktionsdaten basierend auf 1 Million Quadratmetern räumlicher Daten. Das Ziel ist es, komplexe Innenräume zu modellieren und die Sim2Real-Lücke zwischen Simulation und realem Einsatz zu verringern.
Dies ist wichtig für verkörperte Intelligenz, da ein Roboter, der in einem Simulator gut funktioniert, möglicherweise versagt, wenn sich Beleuchtung, Objektplatzierung, Oberflächenreibung oder menschliches Verhalten in einer realen Szene ändern.
Über den Datenumfang hinaus führt DM0.5 drei große Architektur-Upgrades ein. Diese Upgrades sollen Robotern helfen, sich vom "Erinnern von Aktionen" zum "Verstehen von Aufgaben" zu bewegen.
Viele reale Roboteraufgaben sind keine kurzen Ein-Schritt-Befehle. Sie können mehrere Minuten dauern und erfordern, dass der Roboter sich an frühere Ereignisse erinnert.
DM0.5 fügt eine effiziente Kontextkompression hinzu und unterstützt bis zu 60 Sekunden natives Gedächtnis, mit einer durchschnittlichen Gedächtniskapazität von etwa 30 Sekunden. Dies ermöglicht es dem Modell
Um nützlichen historischen Kontext zu bewahren und besser zu verstehen, wie sich die Umgebung während einer längeren Aufgabe verändert hat.
Bei langfristigen Aufgaben kann diese Art von Gedächtnis fragmentiertes Verhalten reduzieren und dem Roboter helfen, eine konsistentere Aktionssequenz beizubehalten.
DM0.5 folgt weiterhin einem VLA-ähnlichen Ansatz, aber Dexmal fügt mehr aufgabenorientierte Überlegungen hinzu, darunter Aufgabenplanung, Zielortbestimmung und Vorhersage zukünftiger Zustände.
Einfach ausgedrückt wird das Modell dazu ermutigt, vor dem Handeln zu planen. Wenn ein Befehl komplex ist, kann es das Ziel in kleinere Schritte unterteilen, die Aktionsreihenfolge organisieren und Versuch-und-Irrtum-Verhalten reduzieren.
Natürlichsprachliche Befehle und Roboter-Gelenkbewegungen existieren in sehr unterschiedlichen Räumen. Eine Person mag einen Satz sagen, aber der Roboter muss diese Anweisung dennoch in millimeterfeine Arm-, Greifer- oder Körperbewegungen übersetzen.
Die Trajektorien-Ausrichtungsschicht hilft dem Modell, Bewegung als einen ausgerichteten Prozess zu lernen, nicht als eine Menge isolierter Punkte. Dies macht das Modell besser darin, das Bewegungsmuster zwischen Absicht und Ausführung zu verstehen.
Zusammen unterstützen diese Verbesserungen Dexmals Behauptung, dass DM0.5 nicht nur Aktionen speichert, sondern eine aufgabenbewusstere Repräsentation der physischen Welt lernt.
Unter diesem Daten- und Architektur-Setup zeigt DM0.5 mehrere berichtete Leistungsverbesserungen in realen Roboter- und Simulationsevaluierungen.
Laut dem Bericht übertrifft DM0.5 aktuelle SOTA-Modelle in vier öffentlichen realen Roboter- und Simulations-Benchmarks. Ein einzelnes Modell kann mehrere Aufgabentypen unterstützen, darunter Navigation, Greifen und Ganzkörpersteuerung.
Im Vergleich zu DM0 verbessert sich DM0.5 Berichten zufolge um:
Die berichtete Latenz ist zudem für den Robotikeinsatz niedrig:
Diese Zahlen sind wichtig, weil verkörperte KI nicht nur genau sein kann. Sie muss auch schnell genug für die Echtzeit-Steuerung der physischen Welt reagieren.
Auf der Entwicklerveranstaltung argumentierte Dexmal-Mitgründer und CEO Tang Wenbin, dass viele verkörperte KI-Modelle veröffentlicht werden, aber die eigentliche Frage sei, ob sie tatsächlich nützlich sind.
Dexmal verwendet zwei praktische Standards, um ein nützliches verkörpertes Grundlagenmodell zu definieren:
Für das Nachtraining senkt DM0.5 Berichten zufolge die Feinabstimmungskosten um 60 %. Eine neue nachgelagerte Aufgabe kann mit nur einer RTX 4090 Consumer-GPU in nur 18 Stunden auf Expertenniveau feinabgestimmt und bereitgestellt werden.
Die größere Veränderung liegt in der Generalisierung. Dexmal betont, dass DM0.5 darauf ausgelegt ist, die Beziehungen zwischen Objekten, Szenen, Aufgaben, Roboter-Verkörperungen und natürlichsprachlichen Anweisungen zu verstehen. Das Unternehmen sagt,
它在DM0.5中已经观察到了泛化涌现的迹象。
零样本能力衡量的是机器人在训练过程中没有见过具体任务时所能完成的工作。
Dexmal在Franka单臂机器人和Dexmal-Mint上,对DM0.5进行了八项核心原子动作的测试:
测试还包括更复杂的指令遵循案例,涉及颜色、形状、大小、状态、绝对位置、相对位置以及长序列指令。
在已报告的评估中,DM0.5在Franka单臂移动能力上与PI 0.5持平,同时在其他测试项目上优于DM0和PI 0.5。
微调能力展示了模型在进入真实任务环境后的适应程度。
在RoboChallenge真实机器人基准测试Table30 V2上,DM0.5在30个复杂任务和四种异构机器人本体上进行了测试。据报告,其得分为54.42,成功率43%,在该评估中排名第一。
该模型还刷新了多个公认的抓取和导航基准测试的结果。在LIBERO中,DM0.5据报告达到了99.1%的整体性能,包括干净场景下的94.1%和随机场景下的94.4%。
重要的实际细节是成本:Dexmal表示,在单个RTX 4090上,新的下游任务可以在18小时内完成微调,而在同类GPU上,推理速度可达90毫秒。
DM0.5支持长达60秒的原生长时间跨度记忆。Dexmal指出,目前许多具身模型通常只能保持10秒以下的记忆。
更长的记忆使机器人能够处理环境随时间变化的多步骤任务。例如,在杂乱的存储或家务整理任务中,机器人需要记住已经移动了什么、还剩下什么,以及场景发生了怎样的变化。
DM0.5还支持视频提示。凭借长时间记忆能力,模型可以理解简短的人类演示视频,并使其行为与演示任务对齐,从而减少对纯语言指令的依赖。
DM0.5采用了双系统设计:
Beschreibe deine Idee einmal, und We0 AI erstellt eine Showcase-Website, Seiten und ein CMS und hilft nach dem Launch bei Kunden und Traffic.
Eine komplette Projektgeneration zur kostenlosen Registrierung
Am besten geeignet, um einen vollständigen Generierungsablauf auszuprobieren und schnell einen ersten Projektentwurf zu sehen.
该模型针对具身场景中两种常见的长尾干扰进行了增强:
这一点很重要,因为现实世界的部署很少像干净的实验室演示那样。人们会移动,相机会偏移,物体并不总是在机器人预期的位置。
DM0.5通过多机器人和多任务集成进行训练,因此旨在实现跨平台迁移。
Dexmal表示,该模型可以适应多种主流和异构机器人类型,包括双足人形机器人、轮式机器人、双臂和单臂操作器以及灵巧手。
Hände.
Der Artikel listet Beispiele wie Aloha, ARX, UR, W1, Unitree G1, Tiangong, Huaqin und Realman auf. Dexmal gibt zudem an, dass das Modell mit leichter Anpassung schnell auf neuen, unbekannten Roboterkörpern eingesetzt werden kann.
Die übergreifende Idee ist, dass Generalisierung Roboter von festen Umgebungen und festen Aktionsskripten wegbringen sollte. Ein allgemeineres Modell kann neue Objekte, neue Szenen, neue Anweisungen und neue Roboter mit weniger kundenspezifischer Arbeit bewältigen.
Ein starkes verkörpertes Foundation Model ist nur der erste Schritt. Damit verkörperte KI in der Industrie funktioniert, benötigt das Modell weiterhin Werkzeuge, Bereitstellungssysteme, Datenrückmeldungen und eine reale Betriebsinfrastruktur.
Dexmal verwendet eine „Dreistufen-Raketen“-Idee, um diesen Stapel zu beschreiben:
Diese Schichten sollen das Modell günstiger im Aufruf, einfacher über Hardware hinweg bereitzustellen und stabiler in realen Aufgabenumgebungen machen.
DexDev ist Dexmals Entwicklerplattform zur Reduzierung der Komplexität bei der Anwendung verkörperter KI-Modelle.
Im aktuellen Bereich der verkörperten KI sind Modelle, Hardware, Aufgaben, Datensätze und Bereitstellungsumgebungen oft fragmentiert. Entwickler müssen möglicherweise gleichzeitig Algorithmen, Robotersteuerung, Hardwareanpassung und Szenarieniteration verstehen.
DexDev ist um drei Module herum aufgebaut.
DFOL2.0 ist ein Framework für verkörpertes Reinforcement Learning und Datenzyklen, angetrieben von Dexmals allgemeinem Weltmodell DW0.5.
Seine Rolle ist es, dem Modell zu helfen, sich ständig zu verbessern. Anstatt sich nur auf teure Versuch-und-Irrtum-Methoden mit echten Robotern zu verlassen, nutzt DFOL2.0 hochrealistische virtuelle physikalische Umgebungen für ein kostengünstigeres und risikoärmeres geschlossenes Politiktraining.
Es speist auch reale Aufgaben- und Fehlerdaten zurück in die Cloud, um dem Foundation Model zu helfen, sich weiterzuentwickeln.
Laut Dexmal kann DFOL2.0 den Bedarf an Trainingsdaten von echten Robotern um 60 % und die Trainingskosten um 40 % senken.
DexOS definiert eine standardisierte ECP- (Embodied Control Protocol) Schnittstelle.
Das Ziel ist es, Unterschiede zwischen heterogener Roboterhardware zu verbergen. Anstatt ein schwieriges „N × M“-Anpassungsproblem zwischen vielen Modellen und vielen Roboterkörpern zu lösen, versucht DexOS, die Bereitstellung auf ein einheitliches „N + 1“-Verbindungsproblem zu vereinfachen.
Dies soll DM-Serienmodellen helfen, mit geringeren Kosten, niedrigerer Latenz und stabilerer Steuerung über verschiedene Hardware hinweg zu laufen.
Dexmal hat außerdem einen verkörperten MaaS-Dienst für die DM-Modellfamilie eingeführt.
Die Idee ist, die Fähigkeiten des Foundation Models als Dienst zu verpacken. Entwickler müssen Modelle nicht von Grund auf trainieren oder jedes Detail der Hardwareanpassung selbst übernehmen. Sie können die Modellfähigkeiten direkter für die Roboterbereitstellung und -upgrades nutzen.
In Dexmals Stapel hilft DFOL2.0 dem Modell, sich zu verbessern, DexOS verbindet Software und Hardware, und MaaS macht das Modell im großen Maßstab einfacher nutzbar.
Ferrata: Ein Multi-Agent-Hybrid-Betriebssystem
Sobald einzelne Roboterfähigkeiten über MaaS (Robotik als Dienstleistung) verfügbar gemacht werden können, besteht die nächste Herausforderung in der Multi-Roboter-Kollaboration.
Dexmal hat Ferrata vorgestellt, ein Multi-Agent-Hybrid-Betriebssystem, das für reale Anwendungsszenarien entwickelt wurde. Es ist darauf ausgelegt, systemübergreifende Planung über mehrere Ziele, Modelle, Roboterformen und Sicherheitsgrenzen hinweg zu bewältigen.
Ferrata basiert auf der DM-Modellfamilie und Realtime-VLA. Es ist nicht auf einen bestimmten Roboter beschränkt. Stattdessen koordiniert es auf Systemebene Aufgaben, Modelle, Hardwaretypen und Sicherheitsmechanismen.
Durch Aufgabenhierarchie, Ausnahmebehandlung, menschliche Übernahme und Datenfeedback zielt Ferrata darauf ab, Roboter in realen Umgebungen kontinuierlich betriebsfähig zu halten.
Von DM0.5 über DexDev bis hin zu Ferrata versucht Dexmal, einen vollständigen Infrastrukturpfad von der Modellfähigkeit bis zur tatsächlichen Produktivität aufzubauen.
Die erste Schicht ist das allgemeine Modell. Die zweite Schicht ist die Plattforminfrastruktur für Training, MaaS und Betriebssysteme. Die dritte Schicht ist ein szenarienorientiertes Betriebssystem, das verkörperter KI hilft, von Labordemonstrationen in Produktionsumgebungen überzugehen.
DM0.5 ist ein von Dexmal eingeführtes Grundlagenmodell für verkörperte KI, auch bekannt als 原力灵机. Es ist als 4B-Parameter-Allgemeinmodell für offene Roboteraufgaben wie Navigation, Greifen, Ganzkörpersteuerung und Befehlsausführung positioniert.
Laut dem Originalbericht basiert DM0.5 auf 150.000 Stunden Daten. Dies umfasst 50.000 Stunden reale Roboterbetriebsdaten, 100.000 Stunden egozentrische Ich-Perspektiven-Daten und großflächige Szenenrekonstruktionsdaten, die eine Million Quadratmeter abdecken.
DM0.5 verdoppelt den Modellparameterskalierungsbereich auf 4B und erhöht die Datenmenge im Vergleich zu DM0 um 400 %. Es fügt außerdem langfristiges Gedächtnis, Aufgaben zur verkörperten Argumentation und Trajektorienausrichtung hinzu, um das Aufgabenverständnis und die Generalisierung zu verbessern.
Der Bericht besagt, dass DM0.5 ein Expert-Level-Feintuning für eine neue nachgelagerte Aufgabe auf einer einzelnen RTX 4090 in nur 18 Stunden abschließen kann. Es werden außerdem 90 ms Inferenzlatenz auf der RTX 4090 und 50 ms auf der H100 angegeben.
DexDev ist die Entwicklerplattform von Dexmal für verkörperte KI-Anwendungen. Es umfasst DFOL2.0 für bestärkendes Lernen und Datenloops, DexOS für hardwareübergreifende Steuerung und MaaS für einen einfacheren Zugang zu Modellfähigkeiten.
Ferrata ist ein Multi-Agent-Hybrid-Betriebssystem für reale Roboterszenarien. Es koordiniert Aufgaben, Roboterhardware, Modelle, Sicherheitsgrenzen, Ausnahmebehandlung, menschliche Übernahme und Datenfeedback.
Der Artikel konzentriert sich auf die Veröffentlichung von DM0.5 und die berichteten Fähigkeiten, gibt jedoch nicht klar an, dass DM0.5 selbst Open Source ist. Dexmal unterhält die Open-Source-Toolbox Dexbotic VLA, und DM0-bezogene Dokumentation ist über das Dexbotic GitHub-Repository verfügbar.
Roboter müssen oft mehrschrittige Aufgaben erledigen, bei denen sich die Szene im Laufe der Zeit ändert. Ein längeres Gedächtnis hilft einem Modell, vorherige Aktionen, den aktuellen Aufgabenstatus und Umweltveränderungen zu verfolgen, wodurch
Der Roboter verliert bei langen Aufgaben seltener den Kontext.
DM0.5 ist Dexmals neuestes verkörpertes Basismodell, das auf größeren Datenmengen, einer 4B-Parameter-Architektur, längerem Gedächtnis, verkörperter Reasoning-Fähigkeit und Trajektorienausrichtung basiert. Sein Hauptziel ist es, die Generalisierung von Robotern über Aufgaben, Umgebungen und Verkörperungen hinweg zu verbessern.
Der Artikel zeigt auch, warum das Modell allein nicht ausreicht. Dexmals DexDev-Plattform, DFOL2.0, DexOS, MaaS und Ferrata-System wurden entwickelt, um die Modellfähigkeit in eine einsetzbare Infrastruktur zu verwandeln.
Die Kernaussage: DM0.5 ist nicht nur ein Modell-Update; es ist Dexmals Versuch, verkörpertes KI-Training, -Bereitstellung und reale Roboteroperationen in einem Stack zu vereinen.
Starte mit einem Satz und erhalte in wenigen Minuten eine vollständige Website.