El auge de los Grandes Modelos de Lenguaje (LLM) proporcionó a la industria de la inteligencia artificial una receta clara: preentrenar arquitecturas masivas con datos a gran escala para desbloquear capacidades generales. Sin embargo, la robótica carecía de un equivalente directo. Históricamente, los sistemas robóticos se han ensamblado a partir de módulos independientes de percepción, planificación y control que rara vez consolidan una inteligencia transferible de una tarea a otra, o de una máquina a otra. X Square Robot, una firma de IA física valorada en más de 20,000 millones de yuanes (aproximadamente 2,900 millones de dólares), ha decidido romper este paradigma mediante el lanzamiento de un stack unificado y de código abierto que promete unificar el aprendizaje de datos, los modelos de mundo y los modelos de acción bajo una única arquitectura: el World Unified Model.
QUANXTA Zero Series: Redefiniendo la captura de datos sin teleoperación costosa
Para el equipo de X Square Robot, el cuello de botella más crítico en el desarrollo de robots de propósito general no radica en el número de parámetros del modelo, sino en el costo y la calidad de los datos de interacción física. Para solucionar esto, la compañía desarrolló el sistema de recolección de datos QUANXTA Zero Series, basado en su Interfaz de Manipulación Universal (UMI). A diferencia de los métodos tradicionales de teleoperación, que obligan al operador humano a trabajar bajo las limitaciones cinemáticas y de latencia de la máquina, este sistema captura las demostraciones directamente de humanos que visten un rig equipado con pinzas duales.
El verdadero factor diferenciador de QUANXTA Zero Series es su riguroso control de calidad mediante un bucle cerrado de inspección física. En lugar de aceptar las trayectorias grabadas de forma pasiva, el sistema ejecuta una muestra de estas trayectorias directamente en el robot real mediante reproducción física (physical playback). Solo aquellas demostraciones que completan la tarea con éxito absoluto son validadas e incorporadas al dataset de entrenamiento. Este enfoque garantiza una tasa de validez del 85%, evitando que errores milimétricos de sincronización —como una pinza que se cierra una fracción de segundo antes y empuja un objeto en lugar de sujetarlo— contaminen el modelo con comportamientos ambiguos.
- QUANXTA Zero Series (UMI): Sistema de captura de datos mediante rigs vestibles que reduce los costos de recolección en un factor de 20x en comparación con la teleoperación tradicional.
- WALL-WM (World Model): Modelo de mundo estructurado en torno a eventos semánticos de duración variable, optimizado para el razonamiento físico de largo horizonte.
- Wall-OSS-0.5 (VLA Model): Modelo de visión-lenguaje-acción diseñado para ejecutarse de forma nativa en hardware real antes de cualquier ajuste fino específico.
- X-Tokenizer: Interfaz semántica que traduce movimientos continuos en tokens discretos estables, permitiendo la transferencia cruzada de encarnaciones (cross-embodiment).
"La verdadera inteligencia física no reside en imitar trayectorias ciegas, sino en comprender cómo cada interacción transforma el estado del mundo real."
WALL-WM: Modelado del mundo estructurado en eventos semánticos
La gran mayoría de los modelos de acción actuales segmentan el comportamiento del robot en ventanas de tiempo fijas (chunks). Aunque esta estructura es conveniente para los controladores de tiempo real, fragmenta artificialmente las acciones físicas, haciendo que los límites de una tarea caigan donde dicta el reloj y no donde termina un movimiento natural. El modelo de mundo de X Square Robot, denominado WALL-WM, aborda este problema organizando el aprendizaje en torno a eventos semánticos fundamentados en la acción (como alcanzar, agarrar, verter o colocar). Estos eventos representan unidades de comportamiento coherentes que pueden ser nombradas en lenguaje natural, identificadas en video y ejecutadas como trayectorias de movimiento.
WALL-WM acopla un modelo de generación de texto a video con una red de acción recién inicializada que extrae características visuales sin sobrescribirlas, preservando los "priors" visuales del modelo base. Esta arquitectura ofrece dos modos operativos complementarios: el modo evento, que opera en segmentos de longitud variable para el razonamiento lógico sobre horizontes temporales prolongados, y el modo chunk, que genera salidas estables y de frecuencia constante para alimentar directamente a los controladores de bajo nivel del robot. En pruebas de generalización sobre entornos no vistos previamente, este enfoque superó de manera consistente a los modelos de control basados en patrones de tiempo fijo.
Wall-OSS-0.5 y X-Tokenizer: Políticas listas para desplegar sin ajuste fino previo
El componente de acción del stack se materializa en Wall-OSS-0.5, un modelo VLA que introduce una exigencia técnica estricta: el modelo preentrenado debe ser capaz de operar en un robot real de forma inmediata, antes de someterse a cualquier proceso de ajuste fino (fine-tuning) específico de la tarea. Para lograrlo, el modelo entrena simultáneamente tres objetivos clave: la generación de tokens de acción discretos, el alineamiento lingüístico y la generación de trayectorias continuas, manteniendo el flujo de gradientes a través de toda la red en lugar de congelar capas intermedias.
Este flujo de control se complementa con X-Tokenizer, una interfaz de tokenización que redefine el movimiento continuo como un lenguaje semántico. En este esquema, los códigos de nivel superior representan la intención abstracta del movimiento (por ejemplo, la dirección general del agarre), mientras que los códigos de nivel inferior contienen los detalles cinemáticos finos. Gracias a esta abstracción, el ruido físico o las pequeñas variaciones en la cinemática de diferentes robots apenas afectan el código de intención, lo que permite reutilizar el mismo tokenizador en múltiples plataformas de hardware sin necesidad de reentrenamiento. Este avance representa un paso crucial hacia la transferencia cruzada de encarnaciones (cross-embodiment), permitiendo que los datos recopilados en un sistema aceleren el aprendizaje de robots con configuraciones físicas completamente distintas.
🔗 Recursos y Enlaces Recomendados para Profundizar
- X Square Robot Research ↗ — Portal oficial de investigación y publicaciones técnicas de la compañía sobre IA física.
- Wall-OSS Open Source Initiative ↗ — Repositorio y recursos abiertos del modelo de visión-lenguaje-acción Wall-OSS-0.5.
- WALL-WM World Model Technical Page ↗ — Detalles de la arquitectura del modelo de mundo basado en eventos semánticos.