{"id":154686,"date":"2023-11-02T20:25:00","date_gmt":"2023-11-02T20:25:00","guid":{"rendered":"http:\/\/rbnews247.com\/v1\/ciencia\/usando-el-lenguaje-para-dar-a-los-robots-una-mejor-comprension-de-un-mundo-abierto-noticias-del-mit\/"},"modified":"2023-11-02T20:25:00","modified_gmt":"2023-11-02T20:25:00","slug":"usando-el-lenguaje-para-dar-a-los-robots-una-mejor-comprension-de-un-mundo-abierto-noticias-del-mit","status":"publish","type":"post","link":"https:\/\/rbnews247.com\/v1\/ciencia\/usando-el-lenguaje-para-dar-a-los-robots-una-mejor-comprension-de-un-mundo-abierto-noticias-del-mit\/","title":{"rendered":"Usando el lenguaje para dar a los robots una mejor comprensi\u00f3n de un mundo abierto |  Noticias del MIT"},"content":{"rendered":"<p> [ad_1]<br \/>\n<br \/><img decoding=\"async\" src=\"https:\/\/news.mit.edu\/sites\/default\/files\/styles\/news_article__cover_image__original\/public\/images\/202310\/MIT-F3RM.png?itok=26tJjDee\" \/><\/p>\n<div>\n<p>Imagina que est\u00e1s visitando a un amigo en el extranjero y miras dentro de su refrigerador para ver qu\u00e9 ser\u00eda un excelente desayuno.  Muchos de los art\u00edculos inicialmente le parecen extra\u00f1os, cada uno de ellos encerrado en envases y contenedores desconocidos.  A pesar de estas distinciones visuales, comienzas a comprender para qu\u00e9 se utiliza cada uno y a elegirlos seg\u00fan sea necesario.<\/p>\n<p>Inspir\u00e1ndose en la capacidad de los humanos para manejar objetos desconocidos, un grupo del Laboratorio de Ciencias de la Computaci\u00f3n e Inteligencia Artificial (CSAIL) del MIT dise\u00f1\u00f3 campos de funciones para la manipulaci\u00f3n rob\u00f3tica (<a href=\"https:\/\/arxiv.org\/abs\/2308.07931\" target=\"_blank\" rel=\"noopener\">F3RM<\/a>), un sistema que combina im\u00e1genes 2D con caracter\u00edsticas del modelo b\u00e1sico en escenas 3D para ayudar a los robots a identificar y agarrar elementos cercanos.  F3RM puede interpretar indicaciones de lenguaje abierto de humanos, lo que hace que el m\u00e9todo sea \u00fatil en entornos del mundo real que contienen miles de objetos, como almacenes y hogares.<\/p>\n<p>F3RM ofrece a los robots la capacidad de interpretar indicaciones de texto abierto utilizando lenguaje natural, ayudando a las m\u00e1quinas a manipular objetos.  Como resultado, las m\u00e1quinas pueden comprender solicitudes menos espec\u00edficas de los humanos y aun as\u00ed completar la tarea deseada.  Por ejemplo, si un usuario le pide al robot que \u201ccoja una taza alta\u201d, el robot puede localizar y agarrar el art\u00edculo que mejor se ajuste a esa descripci\u00f3n.<\/p>\n<p>\"Hacer robots que realmente puedan generalizarse en el mundo real es incre\u00edblemente dif\u00edcil\", dice Ge Yang, postdoctorado en el Instituto de Inteligencia Artificial e Interacciones Fundamentales de la Fundaci\u00f3n Nacional de Ciencias y MIT CSAIL.  \u201cRealmente queremos descubrir c\u00f3mo hacerlo, as\u00ed que con este proyecto intentamos impulsar un nivel agresivo de generalizaci\u00f3n, desde s\u00f3lo tres o cuatro objetos hasta cualquier cosa que encontremos en el Stata Center del MIT.  Quer\u00edamos aprender a hacer robots tan flexibles como nosotros, ya que podemos agarrar y colocar objetos aunque nunca los hayamos visto antes\u201d.<\/p>\n<p><strong>Aprender \u201cqu\u00e9 hay y d\u00f3nde mirando\u201d<\/strong><\/p>\n<p>El m\u00e9todo podr\u00eda ayudar a los robots a recoger art\u00edculos en grandes centros log\u00edsticos con un desorden e imprevisibilidad inevitables.  En estos almacenes, los robots suelen recibir una descripci\u00f3n del inventario que deben identificar.  Los robots deben hacer coincidir el texto proporcionado con un objeto, independientemente de las variaciones en el embalaje, para que los pedidos de los clientes se env\u00eden correctamente.<\/p>\n<p>Por ejemplo, los centros log\u00edsticos de los principales minoristas en l\u00ednea pueden contener millones de art\u00edculos, muchos de los cuales nunca antes habr\u00eda encontrado un robot.  Para operar a tal escala, los robots necesitan comprender la geometr\u00eda y la sem\u00e1ntica de diferentes elementos, algunos de los cuales se encuentran en espacios reducidos.  Con las capacidades avanzadas de percepci\u00f3n espacial y sem\u00e1ntica de F3RM, un robot podr\u00eda volverse m\u00e1s eficaz a la hora de localizar un objeto, colocarlo en un contenedor y luego enviarlo para empaquetarlo.  En \u00faltima instancia, esto ayudar\u00eda a los trabajadores de las f\u00e1bricas a enviar los pedidos de los clientes de manera m\u00e1s eficiente.<\/p>\n<p>\"Una cosa que a menudo sorprende a la gente con F3RM es que el mismo sistema tambi\u00e9n funciona a escala de habitaci\u00f3n y edificio, y puede usarse para construir entornos de simulaci\u00f3n para el aprendizaje de robots y mapas grandes\", dice Yang.  \u201cPero antes de ampliar a\u00fan m\u00e1s este trabajo, primero queremos que este sistema funcione realmente r\u00e1pido.  De esta manera, podemos utilizar este tipo de representaci\u00f3n para tareas de control rob\u00f3tico m\u00e1s din\u00e1micas, con suerte en tiempo real, de modo que los robots que manejan tareas m\u00e1s din\u00e1micas puedan utilizarla para la percepci\u00f3n\u201d.<\/p>\n<p>El equipo del MIT se\u00f1ala que la capacidad del F3RM para comprender diferentes escenas podr\u00eda hacerlo \u00fatil en entornos urbanos y dom\u00e9sticos.  Por ejemplo, este enfoque podr\u00eda ayudar a robots personalizados a identificar y recoger art\u00edculos espec\u00edficos.  El sistema ayuda a los robots a captar su entorno, tanto f\u00edsica como perceptivamente.<\/p>\n<p>\"David Marr defini\u00f3 la percepci\u00f3n visual como el problema de saber 'qu\u00e9 hay y d\u00f3nde mirando'\", dice el autor principal Phillip Isola, profesor asociado de ingenier\u00eda el\u00e9ctrica e inform\u00e1tica del MIT e investigador principal de CSAIL.  \u201cLos modelos de fundaciones recientes se han vuelto realmente buenos al saber lo que est\u00e1n mirando;  pueden reconocer miles de categor\u00edas de objetos y proporcionar descripciones textuales detalladas de im\u00e1genes.  Al mismo tiempo, los campos radiantes se han vuelto muy buenos para representar d\u00f3nde est\u00e1n las cosas en una escena.  La combinaci\u00f3n de estos dos enfoques puede crear una representaci\u00f3n de qu\u00e9 es d\u00f3nde en 3D, y lo que nuestro trabajo muestra es que esta combinaci\u00f3n es especialmente \u00fatil para tareas rob\u00f3ticas, que requieren manipular objetos en 3D\u201d.<\/p>\n<p><strong>Creando un \u201cgemelo digital\u201d<\/strong><\/p>\n<p>F3RM comienza a comprender su entorno tomando fotograf\u00edas con un palo para selfies.  La c\u00e1mara montada toma 50 im\u00e1genes en diferentes poses, lo que le permite construir una <a href=\"https:\/\/www.matthewtancik.com\/nerf\">campo de radiaci\u00f3n neuronal<\/a> (NeRF), un m\u00e9todo de aprendizaje profundo que toma im\u00e1genes 2D para construir una escena 3D.  Este collage de fotograf\u00edas RGB crea un \u201cgemelo digital\u201d de su entorno en forma de una representaci\u00f3n de 360 \u200b\u200bgrados de lo que hay cerca.<\/p>\n<p>Adem\u00e1s de un campo de radiaci\u00f3n neuronal muy detallado, F3RM tambi\u00e9n crea un campo de caracter\u00edsticas para aumentar la geometr\u00eda con informaci\u00f3n sem\u00e1ntica.  El sistema utiliza <a href=\"https:\/\/openai.com\/research\/clip\">ACORTAR<\/a>, un modelo b\u00e1sico de visi\u00f3n entrenado en cientos de millones de im\u00e1genes para aprender conceptos visuales de manera eficiente.  Al reconstruir las caracter\u00edsticas CLIP 2D de las im\u00e1genes tomadas con el palo para selfies, F3RM eleva efectivamente las caracter\u00edsticas 2D a una representaci\u00f3n 3D.<\/p>\n<p><strong>Mantener las cosas abiertas<\/strong><\/p>\n<p>Despu\u00e9s de recibir algunas demostraciones, el robot aplica lo que sabe sobre geometr\u00eda y sem\u00e1ntica para agarrar objetos que nunca antes hab\u00eda encontrado.  Una vez que un usuario env\u00eda una consulta de texto, el robot busca en el espacio de posibles agarres para identificar aquellos con m\u00e1s probabilidades de lograr recoger el objeto solicitado por el usuario.  Cada opci\u00f3n potencial se califica seg\u00fan su relevancia para el mensaje, la similitud con las demostraciones en las que se entren\u00f3 al robot y si causa alguna colisi\u00f3n.  Luego se elige y ejecuta el agarre con la puntuaci\u00f3n m\u00e1s alta.<\/p>\n<p>Para demostrar la capacidad del sistema para interpretar solicitudes abiertas de humanos, los investigadores solicitaron al robot que recogiera a Baymax, un personaje de \"Big Hero 6&#8243; de Disney.  Si bien F3RM nunca hab\u00eda sido entrenado directamente para recoger un juguete del superh\u00e9roe de dibujos animados, el robot utiliz\u00f3 su conciencia espacial y sus caracter\u00edsticas de visi\u00f3n y lenguaje de los modelos b\u00e1sicos para decidir qu\u00e9 objeto agarrar y c\u00f3mo recogerlo.<\/p>\n<p>F3RM tambi\u00e9n permite a los usuarios especificar qu\u00e9 objeto quieren que maneje el robot en diferentes niveles de detalle ling\u00fc\u00edstico.  Por ejemplo, si hay una taza de metal y una taza de vidrio, el usuario puede pedirle al robot la \u201ctaza de vidrio\u201d.  Si el robot ve dos tazas de cristal y una de ellas est\u00e1 llena de caf\u00e9 y la otra de zumo, el usuario puede pedir la \u201ctaza de cristal con caf\u00e9\u201d.  Las caracter\u00edsticas del modelo b\u00e1sico integradas en el campo de caracter\u00edsticas permiten este nivel de comprensi\u00f3n abierta.<\/p>\n<p>\u201cSi le mostrara a una persona c\u00f3mo tomar una taza por el borde, f\u00e1cilmente podr\u00eda transferir ese conocimiento para tomar objetos con geometr\u00edas similares, como tazones, vasos medidores o incluso rollos de cinta adhesiva.  Para los robots, lograr este nivel de adaptabilidad ha sido todo un desaf\u00edo\u201d, dice el estudiante de doctorado del MIT, afiliado a CSAIL y coautor principal William Shen.  \"F3RM combina la comprensi\u00f3n geom\u00e9trica con la sem\u00e1ntica de modelos b\u00e1sicos entrenados con datos a escala de Internet para permitir este nivel de generalizaci\u00f3n agresiva a partir de solo una peque\u00f1a cantidad de demostraciones\".<\/p>\n<p>Shen y Yang escribieron el art\u00edculo bajo la supervisi\u00f3n de Isola, con la profesora del MIT e investigadora principal de CSAIL Leslie Pack Kaelbling y los estudiantes universitarios Alan Yu y Jansen Wong como coautores.  El equipo cont\u00f3 con el apoyo, en parte, de Amazon.com Services, la Fundaci\u00f3n Nacional de Ciencias, la Oficina de Investigaci\u00f3n Cient\u00edfica de la Fuerza A\u00e9rea, la Iniciativa Universitaria Multidisciplinaria de la Oficina de Investigaci\u00f3n Naval, la Oficina de Investigaci\u00f3n del Ej\u00e9rcito, el Laboratorio Watson del MIT-IBM y el MIT en busca de inteligencia.  Su trabajo se presentar\u00e1 en la Conferencia sobre Aprendizaje de Robots de 2023.<\/p>\n<\/p><\/div>\n<p>[ad_2]<br \/>\n<br \/><a href=\"https:\/\/news.mit.edu\/2023\/using-language-give-robots-better-grasp-open-ended-world-1102\">Source link <\/a><\/p>\n","protected":false},"excerpt":{"rendered":"<p>[ad_1] Imagina que est\u00e1s visitando a un amigo en el extranjero y miras dentro de su refrigerador para ver qu\u00e9 ser\u00eda un excelente desayuno. Muchos de los art\u00edculos inicialmente le parecen extra\u00f1os, cada uno de ellos encerrado en envases y contenedores desconocidos. A pesar de estas distinciones visuales, comienzas a comprender para qu\u00e9 se utiliza [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":154687,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_et_pb_use_builder":"","_et_pb_old_content":"","_et_gb_content_width":"","footnotes":""},"categories":[52],"tags":[3972,3964,3969,3960,3965,3966,3961,3967,3973,3971,3962,3959,3963,3968,3970],"class_list":["post-154686","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ciencia","tag-alan-yu","tag-aprendizaje-de-pocas-tomas","tag-campo-de-resplandor-neuronal-nerf","tag-campos-de-funciones-para-manipulacion-robotica-f3rm","tag-campos-de-radiacion-neuronal","tag-caracteristica-campos","tag-comprension-del-robot","tag-ge-yang","tag-jansen-wong","tag-leslie-pack-kaelbling","tag-manipulacion-robotica","tag-mit-csail","tag-modelo-de-lenguaje-visual","tag-phillip-isola","tag-william-shen","et-has-post-format-content","et_post_format-et-post-format-standard"],"_links":{"self":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/posts\/154686","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/comments?post=154686"}],"version-history":[{"count":0,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/posts\/154686\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/media\/154687"}],"wp:attachment":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/media?parent=154686"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/categories?post=154686"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/tags?post=154686"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}