{"id":159515,"date":"2023-11-27T05:00:00","date_gmt":"2023-11-27T05:00:00","guid":{"rendered":"https:\/\/rbnews247.com\/v1\/ciencia\/nuevo-metodo-utiliza-comentarios-de-fuentes-colaborativas-para-ayudar-a-entrenar-robots-noticias-del-mit\/"},"modified":"2023-11-27T05:00:00","modified_gmt":"2023-11-27T05:00:00","slug":"nuevo-metodo-utiliza-comentarios-de-fuentes-colaborativas-para-ayudar-a-entrenar-robots-noticias-del-mit","status":"publish","type":"post","link":"https:\/\/rbnews247.com\/v1\/ciencia\/nuevo-metodo-utiliza-comentarios-de-fuentes-colaborativas-para-ayudar-a-entrenar-robots-noticias-del-mit\/","title":{"rendered":"Nuevo m\u00e9todo utiliza comentarios de fuentes colaborativas para ayudar a entrenar robots |  Noticias del MIT"},"content":{"rendered":"<p> [ad_1]<br \/>\n<br \/><img decoding=\"async\" src=\"https:\/\/news.mit.edu\/sites\/default\/files\/styles\/news_article__cover_image__original\/public\/images\/202311\/MIT-Guided%20Explanation-01.jpg?itok=2jOHdeI0\" \/><\/p>\n<div>\n<p>Para ense\u00f1arle a un agente de IA una nueva tarea, como c\u00f3mo abrir un gabinete de cocina, los investigadores suelen utilizar el aprendizaje por refuerzo, un proceso de prueba y error en el que el agente es recompensado por realizar acciones que lo acerquen a la meta.<\/p>\n<p>En muchos casos, un experto humano debe dise\u00f1ar cuidadosamente una funci\u00f3n de recompensa, que es un mecanismo de incentivo que motiva al agente a explorar.  El experto humano debe actualizar iterativamente esa funci\u00f3n de recompensa a medida que el agente explora e intenta diferentes acciones.  Esto puede llevar mucho tiempo, ser ineficiente y dif\u00edcil de ampliar, especialmente cuando la tarea es compleja e implica muchos pasos.<\/p>\n<p>Investigadores del MIT, la Universidad de Harvard y la Universidad de Washington han desarrollado un nuevo enfoque de aprendizaje por refuerzo que no se basa en una funci\u00f3n de recompensa dise\u00f1ada por expertos.  En cambio, aprovecha los comentarios de muchos usuarios no expertos para guiar al agente a medida que aprende a alcanzar su objetivo.<\/p>\n<p>Si bien algunos otros m\u00e9todos tambi\u00e9n intentan utilizar comentarios de no expertos, este nuevo enfoque permite al agente de IA aprender m\u00e1s r\u00e1pidamente, a pesar de que los datos recopilados de los usuarios a menudo est\u00e1n llenos de errores.  Estos datos ruidosos pueden provocar que otros m\u00e9todos fallen.<\/p>\n<p>Adem\u00e1s, este nuevo enfoque permite recopilar comentarios de forma asincr\u00f3nica, de modo que los usuarios no expertos de todo el mundo puedan contribuir a ense\u00f1ar al agente.<\/p>\n<p>\u201cUna de las partes m\u00e1s desafiantes y que consumen m\u00e1s tiempo en el dise\u00f1o de un agente rob\u00f3tico hoy en d\u00eda es dise\u00f1ar la funci\u00f3n de recompensa.  Hoy en d\u00eda, las funciones de recompensa est\u00e1n dise\u00f1adas por investigadores expertos, un paradigma que no es escalable si queremos ense\u00f1ar a nuestros robots muchas tareas diferentes.  Nuestro trabajo propone una forma de escalar el aprendizaje de robots mediante el crowdsourcing del dise\u00f1o de la funci\u00f3n de recompensa y haciendo posible que los no expertos brinden retroalimentaci\u00f3n \u00fatil\u201d, dice Pulkit Agrawal, profesor asistente en el Departamento de Ingenier\u00eda El\u00e9ctrica y Ciencias de la Computaci\u00f3n (EECS) del MIT que dirige el Improbable AI Lab en el Laboratorio de Ciencias de la Computaci\u00f3n e Inteligencia Artificial del MIT (CSAIL).<\/p>\n<p>En el futuro, este m\u00e9todo podr\u00eda ayudar a un robot a aprender a realizar tareas espec\u00edficas en el hogar de un usuario r\u00e1pidamente, sin que el propietario tenga que mostrarle ejemplos f\u00edsicos de cada tarea.  El robot podr\u00eda explorar por s\u00ed solo, con comentarios no expertos de fuentes colaborativas que guiar\u00edan su exploraci\u00f3n.<\/p>\n<p>\u201cEn nuestro m\u00e9todo, la funci\u00f3n de recompensa gu\u00eda al agente hacia lo que debe explorar, en lugar de decirle exactamente qu\u00e9 debe hacer para completar la tarea.  Entonces, incluso si la supervisi\u00f3n humana es algo inexacta y ruidosa, el agente a\u00fan puede explorar, lo que le ayuda a aprender mucho mejor\u201d, explica el autor principal Marcel Torne &#8217;23, asistente de investigaci\u00f3n en el Improbable AI Lab.<\/p>\n<p>A Torne se unen en el art\u00edculo su asesor del MIT, Agrawal;  el autor principal Abhishek Gupta, profesor asistente de la Universidad de Washington;  as\u00ed como otros en la Universidad de Washington y el MIT.  La investigaci\u00f3n se presentar\u00e1 en la Conferencia sobre Sistemas de Procesamiento de Informaci\u00f3n Neural el pr\u00f3ximo mes.<\/p>\n<p><strong>Comentarios ruidosos<\/strong><\/p>\n<p>Una forma de recopilar comentarios de los usuarios para el aprendizaje por refuerzo es mostrarle dos fotograf\u00edas de los estados logrados por el agente y luego preguntarle qu\u00e9 estado est\u00e1 m\u00e1s cerca de un objetivo.  Por ejemplo, quiz\u00e1s el objetivo de un robot sea abrir un mueble de cocina.  Una imagen podr\u00eda mostrar que el robot abri\u00f3 el gabinete, mientras que la segunda podr\u00eda mostrar que abri\u00f3 el microondas.  Un usuario elegir\u00eda la foto del estado \"mejor\".<\/p>\n<p>Algunos enfoques anteriores intentan utilizar esta retroalimentaci\u00f3n binaria de colaboraci\u00f3n colectiva para optimizar una funci\u00f3n de recompensa que el agente usar\u00eda para aprender la tarea.  Sin embargo, debido a que es probable que los no expertos cometan errores, la funci\u00f3n de recompensa puede volverse muy ruidosa, por lo que el agente podr\u00eda quedarse atascado y nunca alcanzar su objetivo.<\/p>\n<p>\u201cB\u00e1sicamente, el agente se tomar\u00eda demasiado en serio la funci\u00f3n de recompensa.  Intentar\u00eda coincidir perfectamente con la funci\u00f3n de recompensa.  Entonces, en lugar de optimizar directamente la funci\u00f3n de recompensa, simplemente la usamos para decirle al robot qu\u00e9 \u00e1reas deber\u00eda explorar\u201d, dice Torne.<\/p>\n<p>\u00c9l y sus colaboradores dividieron el proceso en dos partes separadas, cada una dirigida por su propio algoritmo.  Llaman a su nuevo m\u00e9todo de aprendizaje por refuerzo HuGE (Exploraci\u00f3n guiada por humanos).<\/p>\n<p>Por un lado, un algoritmo de selecci\u00f3n de objetivos se actualiza continuamente con comentarios humanos de colaboraci\u00f3n colectiva.  La retroalimentaci\u00f3n no se utiliza como funci\u00f3n de recompensa, sino m\u00e1s bien para guiar la exploraci\u00f3n del agente.  En cierto sentido, los usuarios no expertos dejan caer rutas de navegaci\u00f3n que llevan progresivamente al agente hacia su objetivo.<em> <\/em><\/p>\n<p>Por otro lado, el agente explora por s\u00ed solo, de forma autosupervisada y guiado por el seleccionador de objetivos.  Recopila im\u00e1genes o v\u00eddeos de las acciones que intenta, que luego se env\u00edan a humanos y se utilizan para actualizar el selector de objetivos.<\/p>\n<p>Esto reduce el \u00e1rea que el agente puede explorar, lo que lo lleva a \u00e1reas m\u00e1s prometedoras y m\u00e1s cercanas a su objetivo.  Pero si no hay retroalimentaci\u00f3n, o si la retroalimentaci\u00f3n tarda un poco en llegar, el agente seguir\u00e1 aprendiendo por s\u00ed solo, aunque de manera m\u00e1s lenta.  Esto permite recopilar comentarios con poca frecuencia y de forma asincr\u00f3nica.<\/p>\n<p>\u201cEl ciclo de exploraci\u00f3n puede continuar de forma aut\u00f3noma, porque simplemente explorar\u00e1 y aprender\u00e1 cosas nuevas.  Y luego, cuando obtenga una mejor se\u00f1al, se explorar\u00e1 de maneras m\u00e1s concretas.  Puedes hacer que giren a su propio ritmo\u201d, a\u00f1ade Torne.<\/p>\n<p>Y debido a que la retroalimentaci\u00f3n simplemente gu\u00eda suavemente el comportamiento del agente, eventualmente aprender\u00e1 a completar la tarea incluso si los usuarios brindan respuestas incorrectas.<\/p>\n<p><strong>Aprendizaje m\u00e1s r\u00e1pido<\/strong><\/p>\n<p>Los investigadores probaron este m\u00e9todo en una serie de tareas simuladas y del mundo real.  En la simulaci\u00f3n, utilizaron HuGE para aprender eficazmente tareas con largas secuencias de acciones, como apilar bloques en un orden particular o navegar por un gran laberinto.<\/p>\n<p>En pruebas del mundo real, utilizaron HuGE para entrenar brazos rob\u00f3ticos para que dibujaran la letra \"U\" y seleccionaran y colocaran objetos.  Para estas pruebas, reunieron datos de 109 usuarios no expertos en 13 pa\u00edses diferentes en tres continentes.<\/p>\n<p>En experimentos simulados y del mundo real, HuGE ayud\u00f3 a los agentes a aprender a lograr el objetivo m\u00e1s r\u00e1pido que otros m\u00e9todos.<\/p>\n<p>Los investigadores tambi\u00e9n descubrieron que los datos recopilados por no expertos produjeron un mejor rendimiento que los datos sint\u00e9ticos, que fueron producidos y etiquetados por los investigadores.  Para los usuarios no expertos, etiquetar 30 im\u00e1genes o v\u00eddeos llev\u00f3 menos de dos minutos.<\/p>\n<p>\"Esto lo hace muy prometedor en t\u00e9rminos de poder ampliar este m\u00e9todo\", a\u00f1ade Torne.<\/p>\n<p>En un art\u00edculo relacionado, que los investigadores presentaron en la reciente Conferencia sobre Aprendizaje de Robots, mejoraron HuGE para que un agente de IA pueda aprender a realizar la tarea y luego restablecer de forma aut\u00f3noma el entorno para continuar aprendiendo.  Por ejemplo, si el agente aprende a abrir un gabinete, el m\u00e9todo tambi\u00e9n gu\u00eda al agente para que cierre el gabinete.<\/p>\n<p>\"Ahora podemos hacer que aprenda de forma completamente aut\u00f3noma sin necesidad de reinicios humanos\", afirma.<\/p>\n<p>Los investigadores tambi\u00e9n enfatizan que, en este y otros enfoques de aprendizaje, es fundamental garantizar que los agentes de IA est\u00e9n alineados con los valores humanos.<\/p>\n<p>En el futuro, quieren seguir perfeccionando HuGE para que el agente pueda aprender de otras formas de comunicaci\u00f3n, como el lenguaje natural y las interacciones f\u00edsicas con el robot.  Tambi\u00e9n est\u00e1n interesados \u200b\u200ben aplicar este m\u00e9todo para ense\u00f1ar a varios agentes a la vez.<\/p>\n<p>Esta investigaci\u00f3n est\u00e1 financiada, en parte, por el MIT-IBM Watson AI Lab.<\/p>\n<\/p><\/div>\n<p>[ad_2]<br \/>\n<br \/><a href=\"https:\/\/news.mit.edu\/2023\/method-uses-crowdsourced-feedback-help-train-robots-1127\">Source link <\/a><\/p>\n","protected":false},"excerpt":{"rendered":"<p>[ad_1] Para ense\u00f1arle a un agente de IA una nueva tarea, como c\u00f3mo abrir un gabinete de cocina, los investigadores suelen utilizar el aprendizaje por refuerzo, un proceso de prueba y error en el que el agente es recompensado por realizar acciones que lo acerquen a la meta. En muchos casos, un experto humano debe [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":159516,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_et_pb_use_builder":"","_et_pb_old_content":"","_et_gb_content_width":"","footnotes":""},"categories":[52],"tags":[7906,7907,7908,7905,7904],"class_list":["post-159515","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ciencia","tag-abhishek-gupta","tag-aprendizaje-por-refuerzo","tag-exploracion-guiada-por-humanos","tag-marcel-torne","tag-pulkit-agarwal","et-has-post-format-content","et_post_format-et-post-format-standard"],"_links":{"self":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/posts\/159515","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/comments?post=159515"}],"version-history":[{"count":0,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/posts\/159515\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/media\/159516"}],"wp:attachment":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/media?parent=159515"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/categories?post=159515"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/tags?post=159515"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}