{"id":168122,"date":"2024-01-08T20:15:00","date_gmt":"2024-01-08T20:15:00","guid":{"rendered":"https:\/\/rbnews247.com\/v1\/ciencia\/multiples-modelos-de-ia-ayudan-a-los-robots-a-ejecutar-planes-complejos-de-forma-mas-transparente-noticias-del-mit\/"},"modified":"2024-01-08T20:15:00","modified_gmt":"2024-01-08T20:15:00","slug":"multiples-modelos-de-ia-ayudan-a-los-robots-a-ejecutar-planes-complejos-de-forma-mas-transparente-noticias-del-mit","status":"publish","type":"post","link":"https:\/\/rbnews247.com\/v1\/ciencia\/multiples-modelos-de-ia-ayudan-a-los-robots-a-ejecutar-planes-complejos-de-forma-mas-transparente-noticias-del-mit\/","title":{"rendered":"M\u00faltiples modelos de IA ayudan a los robots a ejecutar planes complejos de forma m\u00e1s transparente |  Noticias del MIT"},"content":{"rendered":"<p> [ad_1]<br \/>\n<br \/><img decoding=\"async\" src=\"https:\/\/news.mit.edu\/sites\/default\/files\/styles\/news_article__cover_image__original\/public\/images\/202312\/MIT-Hip-robotics.png?itok=ae3FbAWU\" \/><\/p>\n<div>\n<p>Es probable que su lista de tareas diarias sea bastante sencilla: lavar los platos, comprar alimentos y otras minucias.  Es poco probable que hayas escrito \"recoge el primer plato sucio\" o \"lava ese plato con una esponja\", porque cada uno de estos pasos en miniatura dentro de la tarea parece intuitivo.  Si bien podemos completar cada paso de forma rutinaria sin pensarlo mucho, un robot requiere un plan complejo que incluye esquemas m\u00e1s detallados.<\/p>\n<p>El Improbable AI Lab del MIT, un grupo dentro del Laboratorio de Ciencias de la Computaci\u00f3n e Inteligencia Artificial (CSAIL), ha ofrecido ayuda a estas m\u00e1quinas con un nuevo marco multimodal: <a href=\"https:\/\/hierarchical-planning-foundation-model.github.io\/\" target=\"_blank\" rel=\"noopener\">Modelos de fundamentos compositivos para la planificaci\u00f3n jer\u00e1rquica<\/a> (HiP), que desarrolla planes detallados y factibles con la experiencia de tres modelos de cimentaci\u00f3n diferentes.  Al igual que GPT-4 de OpenAI, el modelo b\u00e1sico sobre el que se construyeron ChatGPT y Bing Chat, estos modelos b\u00e1sicos se entrenan con cantidades masivas de datos para aplicaciones como generar im\u00e1genes, traducir texto y rob\u00f3tica.<\/p>\n<p>A diferencia de RT2 y otros modelos multimodales que se entrenan con datos emparejados de visi\u00f3n, lenguaje y acci\u00f3n, HiP utiliza tres modelos b\u00e1sicos diferentes, cada uno de ellos entrenado con diferentes modalidades de datos.  Cada modelo b\u00e1sico captura una parte diferente del proceso de toma de decisiones y luego trabaja en conjunto cuando llega el momento de tomar decisiones.  HiP elimina la necesidad de acceder a datos combinados de visi\u00f3n, lenguaje y acci\u00f3n, que es dif\u00edcil de obtener.  HiP tambi\u00e9n hace que el proceso de razonamiento sea m\u00e1s transparente.<\/p>\n<p>Lo que se considera una tarea diaria para un ser humano puede ser la \u201cmeta a largo plazo\u201d de un robot (un objetivo general que implica completar muchos pasos m\u00e1s peque\u00f1os primero) que requiere datos suficientes para planificar, comprender y ejecutar objetivos.  Si bien los investigadores de visi\u00f3n por computadora han intentado construir modelos b\u00e1sicos monol\u00edticos para este problema, combinar datos de lenguaje, visuales y de acci\u00f3n es costoso.  En cambio, HiP representa una receta multimodal diferente: un tr\u00edo que incorpora de forma econ\u00f3mica inteligencia ling\u00fc\u00edstica, f\u00edsica y ambiental en un robot.<\/p>\n<p>\"Los modelos b\u00e1sicos no tienen por qu\u00e9 ser monol\u00edticos\", afirma el investigador de IA de NVIDIA, Jim Fan, que no particip\u00f3 en el art\u00edculo.  \u201cEste trabajo descompone la compleja tarea de la planificaci\u00f3n de agentes encarnados en tres modelos constituyentes: un razonamiento ling\u00fc\u00edstico, un modelo del mundo visual y un planificador de acciones.  Hace que un problema dif\u00edcil de toma de decisiones sea m\u00e1s manejable y transparente\u201d.<\/p>\n<p>El equipo cree que su sistema podr\u00eda ayudar a estas m\u00e1quinas a realizar tareas dom\u00e9sticas, como guardar un libro o colocar un recipiente en el lavavajillas.  Adem\u00e1s, HiP podr\u00eda ayudar con tareas de construcci\u00f3n y fabricaci\u00f3n de varios pasos, como apilar y colocar diferentes materiales en secuencias espec\u00edficas.<\/p>\n<p><strong>Evaluaci\u00f3n de HiP<\/strong><\/p>\n<p>El equipo de CSAIL prob\u00f3 la agudeza de HiP en tres tareas de manipulaci\u00f3n, superando a marcos comparables.  El sistema razon\u00f3 desarrollando planes inteligentes que se adaptan a la nueva informaci\u00f3n.<\/p>\n<p>Primero, los investigadores le pidieron que apilara bloques de diferentes colores entre s\u00ed y luego colocara otros cerca.  El problema: algunos de los colores correctos no estaban presentes, por lo que el robot tuvo que colocar bloques blancos en un recipiente de colores para pintarlos.  HiP a menudo se ajustaba a estos cambios con precisi\u00f3n, especialmente en comparaci\u00f3n con sistemas de planificaci\u00f3n de tareas de \u00faltima generaci\u00f3n como Transformer BC y Action Difusor, ajustando sus planes para apilar y colocar cada cuadrado seg\u00fan fuera necesario.<\/p>\n<p>Otra prueba: colocar objetos como dulces y un martillo en una caja marr\u00f3n ignorando otros elementos.  Algunos de los objetos que necesitaba mover estaban sucios, por lo que HiP ajust\u00f3 sus planes para colocarlos en una caja de limpieza y luego en el contenedor marr\u00f3n.  En una tercera demostraci\u00f3n, el robot pudo ignorar objetos innecesarios para completar objetivos secundarios de la cocina, como abrir un microondas, retirar una tetera y encender una luz.  Algunos de los pasos indicados ya se hab\u00edan completado, por lo que el robot se adapt\u00f3 omitiendo esas instrucciones.<\/p>\n<p><strong>Una jerarqu\u00eda triple<\/strong><\/p>\n<p>El proceso de planificaci\u00f3n triple de HiP opera como una jerarqu\u00eda, con la capacidad de entrenar previamente cada uno de sus componentes en diferentes conjuntos de datos, incluida informaci\u00f3n fuera de la rob\u00f3tica.  Al final de ese orden hay un modelo de lenguaje grande (LLM), que comienza a idear capturando toda la informaci\u00f3n simb\u00f3lica necesaria y desarrollando un plan de tarea abstracto.  Aplicando el conocimiento de sentido com\u00fan que encuentra en Internet, el modelo divide su objetivo en submetas.  Por ejemplo, \u201cpreparar una taza de t\u00e9\u201d se convierte en \u201cllenar una olla con agua\u201d, \u201chervir la olla\u201d y las acciones posteriores requeridas.<\/p>\n<p>\"Todo lo que queremos hacer es tomar modelos existentes previamente entrenados y hacer que interact\u00faen exitosamente entre s\u00ed\", dice Anurag Ajay, estudiante de doctorado en el Departamento de Ingenier\u00eda El\u00e9ctrica y Ciencias de la Computaci\u00f3n (EECS) del MIT y afiliado de CSAIL.  \u201cEn lugar de presionar para que un modelo lo haga todo, combinamos varios que aprovechan diferentes modalidades de datos de Internet.  Cuando se usan en conjunto, ayudan con la toma de decisiones rob\u00f3tica y potencialmente pueden ayudar con tareas en hogares, f\u00e1bricas y sitios de construcci\u00f3n\u201d.<\/p>\n<p>Estos modelos tambi\u00e9n necesitan alg\u00fan tipo de \"ojos\" para comprender el entorno en el que operan y ejecutar correctamente cada subobjetivo.  El equipo utiliz\u00f3 un modelo de difusi\u00f3n de video de gran tama\u00f1o para aumentar la planificaci\u00f3n inicial completada por el LLM, que recopila informaci\u00f3n geom\u00e9trica y f\u00edsica sobre el mundo a partir de im\u00e1genes en Internet.  A su vez, el modelo de video genera un plan de trayectoria de observaci\u00f3n, refinando el esquema del LLM para incorporar nuevos conocimientos f\u00edsicos.<\/p>\n<p>Este proceso, conocido como refinamiento iterativo, permite a HiP razonar sobre sus ideas y recibir comentarios en cada etapa para generar un esquema m\u00e1s pr\u00e1ctico.  El flujo de retroalimentaci\u00f3n es similar a escribir un art\u00edculo, donde un autor puede enviar su borrador a un editor y, con esas revisiones incorporadas, el editor revisa los \u00faltimos cambios y finaliza.<\/p>\n<p>En este caso, la cima de la jerarqu\u00eda es un modelo de acci\u00f3n egoc\u00e9ntrico, o una secuencia de im\u00e1genes en primera persona que infiere qu\u00e9 acciones deben tener lugar en funci\u00f3n de su entorno.  Durante esta etapa, el plan de observaci\u00f3n del modelo de v\u00eddeo se mapea sobre el espacio visible para el robot, ayudando a la m\u00e1quina a decidir c\u00f3mo ejecutar cada tarea dentro del objetivo a largo plazo.  Si un robot usa HiP para preparar t\u00e9, esto significa que habr\u00e1 trazado exactamente d\u00f3nde est\u00e1n la olla, el fregadero y otros elementos visuales clave, y comenzar\u00e1 a completar cada subobjetivo.<\/p>\n<p>Aun as\u00ed, el trabajo multimodal est\u00e1 limitado por la falta de modelos b\u00e1sicos de v\u00eddeo de alta calidad.  Una vez disponibles, podr\u00edan interactuar con los modelos de v\u00eddeo a peque\u00f1a escala de HiP para mejorar a\u00fan m\u00e1s la predicci\u00f3n de secuencias visuales y la generaci\u00f3n de acciones rob\u00f3ticas.  Una versi\u00f3n de mayor calidad tambi\u00e9n reducir\u00eda los requisitos de datos actuales de los modelos de v\u00eddeo.<\/p>\n<p>Dicho esto, el enfoque del equipo de CSAIL solo utiliz\u00f3 una peque\u00f1a cantidad de datos en general.  Adem\u00e1s, HiP fue barato de entrenar y demostr\u00f3 el potencial de utilizar modelos b\u00e1sicos f\u00e1cilmente disponibles para completar tareas a largo plazo.  \u201cLo que Anurag ha demostrado es una prueba de concepto de c\u00f3mo podemos tomar modelos entrenados en tareas y modalidades de datos separadas y combinarlos en modelos para la planificaci\u00f3n rob\u00f3tica.  En el futuro, HiP podr\u00eda ampliarse con modelos previamente entrenados que puedan procesar el tacto y el sonido para hacer mejores planes\u201d, afirma el autor principal Pulkit Agrawal, profesor asistente en EECS del MIT y director del Improbable AI Lab.  El grupo tambi\u00e9n est\u00e1 considerando aplicar HiP para resolver tareas de rob\u00f3tica a largo plazo en el mundo real.<\/p>\n<p>Ajay y Agrawal son los autores principales de un <a href=\"https:\/\/arxiv.org\/abs\/2309.08587\" target=\"_blank\" rel=\"noopener\">documento que describe el trabajo<\/a>.  A ellos se unen los profesores del MIT y los investigadores principales de CSAIL, Tommi Jaakkola, Joshua Tenenbaum y Leslie Pack Kaelbling;  Akash Srivastava, afiliado de investigaci\u00f3n de CSAIL y director de investigaci\u00f3n del MIT-IBM AI Lab;  los estudiantes de posgrado Seungwook Han y Yilun Du &#8217;19;  el ex postdoctorado Abhishek Gupta, que ahora es profesor asistente en la Universidad de Washington;  y el ex estudiante de posgrado Shuang Li PhD &#8217;23.<\/p>\n<p>El trabajo del equipo fue apoyado, en parte, por la Fundaci\u00f3n Nacional de Ciencias, la Agencia de Proyectos de Investigaci\u00f3n Avanzada de Defensa de EE. UU., la Oficina de Investigaci\u00f3n del Ej\u00e9rcito de EE. UU., la Oficina de Iniciativas de Investigaci\u00f3n Universitaria Multidisciplinaria de Investigaci\u00f3n Naval de EE. UU. y el Laboratorio de IA Watson del MIT-IBM.  Sus hallazgos se presentaron en la Conferencia de 2023 sobre sistemas de procesamiento de informaci\u00f3n neuronal (NeurIPS).<\/p>\n<\/p><\/div>\n<p>[ad_2]<br \/>\n<br \/><a href=\"https:\/\/news.mit.edu\/2024\/multiple-ai-models-help-robots-execute-complex-plans-more-transparently-0108\">Source link <\/a><\/p>\n","protected":false},"excerpt":{"rendered":"<p>[ad_1] Es probable que su lista de tareas diarias sea bastante sencilla: lavar los platos, comprar alimentos y otras minucias. Es poco probable que hayas escrito \"recoge el primer plato sucio\" o \"lava ese plato con una esponja\", porque cada uno de estos pasos en miniatura dentro de la tarea parece intuitivo. Si bien podemos [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":168123,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_et_pb_use_builder":"","_et_pb_old_content":"","_et_gb_content_width":"","footnotes":""},"categories":[52],"tags":[13429,13427,3959,13421,13426,13425,13422,13424,13428,13430,13423],"class_list":["post-168122","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ciencia","tag-anurag-ajay","tag-metas-a-largo-plazo","tag-mit-csail","tag-mit-improbable-ai-lab","tag-modelo-de-accion-egocentrica","tag-modelo-de-difusion-de-video","tag-modelos-basicos-de-composicion-para-la-planificacion-jerarquica-hip","tag-modelos-de-lenguaje-grande","tag-planificacion-de-robots","tag-pulkit-agrawal","tag-sistema-de-ia-multimodal","et-has-post-format-content","et_post_format-et-post-format-standard"],"_links":{"self":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/posts\/168122","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/comments?post=168122"}],"version-history":[{"count":0,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/posts\/168122\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/media\/168123"}],"wp:attachment":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/media?parent=168122"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/categories?post=168122"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/tags?post=168122"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}