{"id":163662,"date":"2023-12-15T17:35:00","date_gmt":"2023-12-15T17:35:00","guid":{"rendered":"https:\/\/rbnews247.com\/v1\/ciencia\/precision-del-reconocimiento-de-imagenes-un-desafio-invisible-que-confunde-a-la-ia-actual-noticias-del-mit\/"},"modified":"2023-12-15T17:35:00","modified_gmt":"2023-12-15T17:35:00","slug":"precision-del-reconocimiento-de-imagenes-un-desafio-invisible-que-confunde-a-la-ia-actual-noticias-del-mit","status":"publish","type":"post","link":"https:\/\/rbnews247.com\/v1\/ciencia\/precision-del-reconocimiento-de-imagenes-un-desafio-invisible-que-confunde-a-la-ia-actual-noticias-del-mit\/","title":{"rendered":"Precisi\u00f3n del reconocimiento de im\u00e1genes: un desaf\u00edo invisible que confunde a la IA actual |  Noticias del MIT"},"content":{"rendered":"<p> [ad_1]<br \/>\n<br \/><img decoding=\"async\" src=\"https:\/\/news.mit.edu\/sites\/default\/files\/styles\/news_article__cover_image__original\/public\/images\/202312\/MIT-MVT-00.jpg?itok=I4BxNthj\" \/><\/p>\n<div>\n<p>Imagina que est\u00e1s navegando por las fotos de tu tel\u00e9fono y te encuentras con una imagen que al principio no puedes reconocer.  Quiz\u00e1s parezca algo borroso en el sof\u00e1;  \u00bfPodr\u00eda ser una almohada o un abrigo?  Despu\u00e9s de un par de segundos, hace clic, \u00a1por supuesto!  Esa bola de pelusa es el gato de tu amigo, Mocha.  Si bien algunas de tus fotos se pueden entender en un instante, \u00bfpor qu\u00e9 esta foto de gato fue mucho m\u00e1s dif\u00edcil?<\/p>\n<p>Los investigadores del Laboratorio de Ciencias de la Computaci\u00f3n e Inteligencia Artificial (CSAIL) del MIT se sorprendieron al descubrir que, a pesar de la importancia cr\u00edtica de comprender los datos visuales en \u00e1reas fundamentales que van desde la atenci\u00f3n m\u00e9dica hasta el transporte y los dispositivos dom\u00e9sticos, la noci\u00f3n de la dificultad de reconocimiento de una imagen para los humanos ha sido casi completamente ignorada. ignorado.  Uno de los principales impulsores del progreso en la IA basada en el aprendizaje profundo han sido los conjuntos de datos; sin embargo, sabemos poco sobre c\u00f3mo los datos impulsan el progreso en el aprendizaje profundo a gran escala m\u00e1s all\u00e1 de que cuanto m\u00e1s, mejor.<\/p>\n<p>En aplicaciones del mundo real que requieren comprender datos visuales, los humanos superan a los modelos de reconocimiento de objetos a pesar de que los modelos funcionan bien en conjuntos de datos actuales, incluidos aquellos dise\u00f1ados expl\u00edcitamente para desafiar a las m\u00e1quinas con im\u00e1genes sesgadas o cambios de distribuci\u00f3n.  Este problema persiste, en parte, porque no tenemos orientaci\u00f3n sobre la dificultad absoluta de una imagen o conjunto de datos.  Sin controlar la dificultad de las im\u00e1genes utilizadas para la evaluaci\u00f3n, es dif\u00edcil evaluar objetivamente el progreso hacia el desempe\u00f1o a nivel humano, cubrir la gama de habilidades humanas y aumentar el desaf\u00edo que plantea un conjunto de datos.<\/p>\n<p>Para llenar este vac\u00edo de conocimiento, David Mayo, estudiante de doctorado del MIT en ingenier\u00eda el\u00e9ctrica e inform\u00e1tica y afiliado de CSAIL, profundiz\u00f3 en el mundo profundo de los conjuntos de datos de im\u00e1genes, explorando por qu\u00e9 ciertas im\u00e1genes son m\u00e1s dif\u00edciles de reconocer para los humanos y las m\u00e1quinas que otras.  \"Algunas im\u00e1genes inherentemente tardan m\u00e1s en reconocerse, y es esencial comprender la actividad del cerebro durante este proceso y su relaci\u00f3n con los modelos de aprendizaje autom\u00e1tico. Quiz\u00e1s existan circuitos neuronales complejos o mecanismos \u00fanicos que faltan en nuestros modelos actuales, visibles solo cuando se prueban con im\u00e1genes desafiantes. \"Est\u00edmulos. Esta exploraci\u00f3n es crucial para comprender y mejorar los modelos de visi\u00f3n artificial\", dice Mayo, autor principal de un nuevo art\u00edculo. <a href=\"https:\/\/objectnet.dev\/mvt\/how_hard_are_computer_vision_datasets_Calibrating_dataset_difficulty_to_viewing_time_neurips2023.pdf\" target=\"_blank\" rel=\"noopener\">documento sobre el trabajo<\/a>.<\/p>\n<p>Esto llev\u00f3 al desarrollo de una nueva m\u00e9trica, la \u201c<a href=\"https:\/\/objectnet.dev\/mvt\/\" target=\"_blank\" rel=\"noopener\">tiempo m\u00ednimo de visualizaci\u00f3n<\/a>\u201d(MVT), que cuantifica la dificultad de reconocer una imagen en funci\u00f3n del tiempo que una persona necesita visualizarla antes de realizar una identificaci\u00f3n correcta.  Utilizando un subconjunto de ImageNet, un conjunto de datos popular en aprendizaje autom\u00e1tico, y ObjectNet, un conjunto de datos dise\u00f1ado para probar la solidez del reconocimiento de objetos, el equipo mostr\u00f3 im\u00e1genes a los participantes con duraciones variables, desde tan solo 17 milisegundos hasta 10 segundos, y les pregunt\u00f3. para elegir el objeto correcto entre un conjunto de 50 opciones.  Despu\u00e9s de m\u00e1s de 200.000 pruebas de presentaci\u00f3n de im\u00e1genes, el equipo descubri\u00f3 que los conjuntos de pruebas existentes, incluido ObjectNet, parec\u00edan sesgados hacia im\u00e1genes MVT m\u00e1s cortas y m\u00e1s f\u00e1ciles, y la gran mayor\u00eda del rendimiento de referencia se derivaba de im\u00e1genes que son f\u00e1ciles para los humanos.<\/p>\n<p>El proyecto identific\u00f3 tendencias interesantes en el rendimiento del modelo, particularmente en relaci\u00f3n con el escalamiento.  Los modelos m\u00e1s grandes mostraron mejoras considerables en im\u00e1genes m\u00e1s simples, pero progresaron menos en im\u00e1genes m\u00e1s desafiantes.  Los modelos CLIP, que incorporan tanto el lenguaje como la visi\u00f3n, se destacaron a medida que avanzaban hacia un reconocimiento m\u00e1s parecido al humano.<\/p>\n<p>\u201cTradicionalmente, los conjuntos de datos de reconocimiento de objetos se han inclinado hacia im\u00e1genes menos complejas, una pr\u00e1ctica que ha llevado a una inflaci\u00f3n en las m\u00e9tricas de rendimiento del modelo, que no refleja realmente la solidez de un modelo o su capacidad para abordar tareas visuales complejas.  Nuestra investigaci\u00f3n revela que las im\u00e1genes m\u00e1s duras plantean un desaf\u00edo m\u00e1s grave, provocando un cambio en la distribuci\u00f3n que a menudo no se tiene en cuenta en las evaluaciones est\u00e1ndar\u201d, afirma Mayo.  \u201cLanzamos conjuntos de im\u00e1genes etiquetadas por dificultad junto con herramientas para calcular autom\u00e1ticamente MVT, lo que permite agregar MVT a los puntos de referencia existentes y extenderlos a varias aplicaciones.  Estos incluyen medir la dificultad del conjunto de pruebas antes de implementar sistemas del mundo real, descubrir correlatos neuronales de la dificultad de la imagen y avanzar en t\u00e9cnicas de reconocimiento de objetos para cerrar la brecha entre el rendimiento de referencia y el del mundo real\u201d.<\/p>\n<p>\u201cUna de mis conclusiones m\u00e1s importantes es que ahora tenemos otra dimensi\u00f3n en la que evaluar los modelos.  Queremos modelos que sean capaces de reconocer cualquier imagen incluso si (quiz\u00e1s especialmente si) es dif\u00edcil de reconocer para un humano.  Somos los primeros en cuantificar lo que esto significar\u00eda.  Nuestros resultados muestran que no s\u00f3lo no es el caso con el estado del arte actual, sino tambi\u00e9n que nuestros m\u00e9todos de evaluaci\u00f3n actuales no tienen la capacidad de decirnos cu\u00e1ndo es el caso porque los conjuntos de datos est\u00e1ndar est\u00e1n muy sesgados hacia im\u00e1genes f\u00e1ciles\u201d. dice Jesse Cummings, estudiante de posgrado del MIT en ingenier\u00eda el\u00e9ctrica e inform\u00e1tica y coautor del art\u00edculo con Mayo.<\/p>\n<p><strong>De ObjectNet a MVT<\/strong><\/p>\n<p>Hace unos a\u00f1os, el equipo detr\u00e1s de este proyecto identific\u00f3 un desaf\u00edo importante en el campo del aprendizaje autom\u00e1tico: los modelos ten\u00edan problemas con im\u00e1genes fuera de distribuci\u00f3n o im\u00e1genes que no estaban bien representadas en los datos de entrenamiento.  Ingrese a ObjectNet, un conjunto de datos compuesto por im\u00e1genes recopiladas de entornos de la vida real.  El conjunto de datos ayud\u00f3 a iluminar la brecha de rendimiento entre los modelos de aprendizaje autom\u00e1tico y las capacidades de reconocimiento humano, al eliminar correlaciones falsas presentes en otros puntos de referencia, por ejemplo, entre un objeto y su fondo.  ObjectNet ilumin\u00f3 la brecha entre el rendimiento de los modelos de visi\u00f3n artificial en conjuntos de datos y en aplicaciones del mundo real, fomentando su uso por parte de muchos investigadores y desarrolladores, lo que posteriormente mejor\u00f3 el rendimiento del modelo.<\/p>\n<p>Un avance r\u00e1pido hasta el presente, y el equipo ha llevado su investigaci\u00f3n un paso m\u00e1s all\u00e1 con MVT.  A diferencia de los m\u00e9todos tradicionales que se centran en el rendimiento absoluto, este nuevo enfoque eval\u00faa el rendimiento de los modelos contrastando sus respuestas con las im\u00e1genes m\u00e1s f\u00e1ciles y m\u00e1s dif\u00edciles.  El estudio explor\u00f3 m\u00e1s a fondo c\u00f3mo se podr\u00eda explicar la dificultad de la imagen y probar su similitud con el procesamiento visual humano.  Utilizando m\u00e9tricas como c-score, profundidad de predicci\u00f3n y robustez del adversario, el equipo descubri\u00f3 que las redes procesan las im\u00e1genes m\u00e1s dif\u00edciles de manera diferente.  \"Si bien hay tendencias observables, como que las im\u00e1genes m\u00e1s f\u00e1ciles son m\u00e1s protot\u00edpicas, la comunidad cient\u00edfica sigue eludiendo una explicaci\u00f3n sem\u00e1ntica integral de la dificultad de la imagen\", dice Mayo.<\/p>\n<p>En el \u00e1mbito de la atenci\u00f3n sanitaria, por ejemplo, la pertinencia de comprender la complejidad visual se vuelve a\u00fan m\u00e1s pronunciada.  La capacidad de los modelos de IA para interpretar im\u00e1genes m\u00e9dicas, como los rayos X, est\u00e1 sujeta a la diversidad y dificultad de distribuci\u00f3n de las im\u00e1genes.  Los investigadores abogan por un an\u00e1lisis meticuloso de la distribuci\u00f3n de las dificultades adaptado a los profesionales, garantizando que los sistemas de IA se eval\u00faen seg\u00fan est\u00e1ndares de expertos, en lugar de interpretaciones de personas no profesionales.<\/p>\n<p>Mayo y Cummings actualmente tambi\u00e9n est\u00e1n analizando los fundamentos neurol\u00f3gicos del reconocimiento visual, investigando si el cerebro exhibe actividad diferencial cuando procesa im\u00e1genes f\u00e1ciles versus desafiantes.  El estudio tiene como objetivo desentra\u00f1ar si las im\u00e1genes complejas reclutan \u00e1reas cerebrales adicionales que no suelen asociarse con el procesamiento visual, con la esperanza de ayudar a desmitificar c\u00f3mo nuestros cerebros decodifican el mundo visual de manera precisa y eficiente.<\/p>\n<p><strong>Hacia un desempe\u00f1o a nivel humano<\/strong><\/p>\n<p>De cara al futuro, los investigadores no s\u00f3lo se centran en explorar formas de mejorar las capacidades predictivas de la IA con respecto a la dificultad de las im\u00e1genes.  El equipo est\u00e1 trabajando para identificar correlaciones con la dificultad del tiempo de visualizaci\u00f3n para generar versiones de im\u00e1genes m\u00e1s dif\u00edciles o m\u00e1s f\u00e1ciles.<\/p>\n<p>A pesar de los importantes avances del estudio, los investigadores reconocen limitaciones, particularmente en t\u00e9rminos de la separaci\u00f3n del reconocimiento de objetos de las tareas de b\u00fasqueda visual.  La metodolog\u00eda actual se concentra en reconocer objetos, dejando de lado las complejidades introducidas por im\u00e1genes desordenadas.<\/p>\n<p>\"Este enfoque integral aborda el desaf\u00edo de larga data de evaluar objetivamente el progreso hacia el desempe\u00f1o a nivel humano en el reconocimiento de objetos y abre nuevas v\u00edas para comprender y avanzar en este campo\", dice Mayo.  \u201cCon el potencial de adaptar la m\u00e9trica de dificultad del tiempo m\u00ednimo de visualizaci\u00f3n para una variedad de tareas visuales, este trabajo allana el camino para un rendimiento m\u00e1s s\u00f3lido y similar al humano en el reconocimiento de objetos, asegurando que los modelos sean realmente puestos a prueba y est\u00e9n listos para el complejidades de la comprensi\u00f3n visual del mundo real\u201d.<\/p>\n<p>\"Este es un estudio fascinante sobre c\u00f3mo se puede utilizar la percepci\u00f3n humana para identificar debilidades en la forma en que normalmente se comparan los modelos de visi\u00f3n de IA, que sobreestiman el rendimiento de la IA al concentrarse en im\u00e1genes sencillas\", dice Alan L. Yuille, Profesor Distinguido de Ciencias Cognitivas y Ciencias Cognitivas de Bloomberg. Ciencias de la Computaci\u00f3n de la Universidad Johns Hopkins, que no particip\u00f3 en el art\u00edculo.  \"Esto ayudar\u00e1 a desarrollar puntos de referencia m\u00e1s realistas que conducir\u00e1n no s\u00f3lo a mejoras en la IA, sino tambi\u00e9n a realizar comparaciones m\u00e1s justas entre la IA y la percepci\u00f3n humana\". <\/p>\n<p>\"Se afirma ampliamente que los sistemas de visi\u00f3n por computadora ahora superan a los humanos, y en algunos conjuntos de datos de referencia, eso es cierto\", dice el miembro del personal t\u00e9cnico de Anthropic Simon Kornblith PhD &#8217;17, que tampoco particip\u00f3 en este trabajo.  \u201cSin embargo, gran parte de la dificultad en esos puntos de referencia proviene de la oscuridad de lo que hay en las im\u00e1genes;  la persona promedio simplemente no sabe lo suficiente como para clasificar diferentes razas de perros.  En cambio, este trabajo se centra en im\u00e1genes que las personas s\u00f3lo pueden lograr correctamente si se les da suficiente tiempo.  Estas im\u00e1genes son generalmente mucho m\u00e1s dif\u00edciles para los sistemas de visi\u00f3n por computadora, pero los mejores sistemas son s\u00f3lo un poco peores que los humanos\u201d.<\/p>\n<p>Mayo, Cummings y Xinyu Lin MEng &#8217;22 escribieron el <a href=\"https:\/\/objectnet.dev\/mvt\/how_hard_are_computer_vision_datasets_Calibrating_dataset_difficulty_to_viewing_time_neurips2023.pdf\" target=\"_blank\" rel=\"noopener\">papel<\/a> junto con el cient\u00edfico investigador de CSAIL Andrei Barbu, el cient\u00edfico investigador principal de CSAIL Boris Katz y el investigador principal del laboratorio de IA Watson del MIT-IBM, Dan Gutfreund.  Los investigadores son afiliados del Centro MIT para Cerebros, Mentes y M\u00e1quinas.<\/p>\n<p>El equipo presentar\u00e1 su trabajo en la Conferencia de 2023 sobre sistemas de procesamiento de informaci\u00f3n neuronal (NeurIPS).<\/p>\n<\/p><\/div>\n<p>[ad_2]<br \/>\n<br \/><a href=\"https:\/\/news.mit.edu\/2023\/image-recognition-accuracy-minimum-viewing-time-metric-1215\">Source link <\/a><\/p>\n","protected":false},"excerpt":{"rendered":"<p>[ad_1] Imagina que est\u00e1s navegando por las fotos de tu tel\u00e9fono y te encuentras con una imagen que al principio no puedes reconocer. Quiz\u00e1s parezca algo borroso en el sof\u00e1; \u00bfPodr\u00eda ser una almohada o un abrigo? Despu\u00e9s de un par de segundos, hace clic, \u00a1por supuesto! Esa bola de pelusa es el gato de [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_et_pb_use_builder":"","_et_pb_old_content":"","_et_gb_content_width":"","footnotes":""},"categories":[52],"tags":[],"class_list":["post-163662","post","type-post","status-publish","format-standard","hentry","category-ciencia","et-doesnt-have-format-content","et_post_format-et-post-format-standard"],"_links":{"self":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/posts\/163662","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/comments?post=163662"}],"version-history":[{"count":0,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/posts\/163662\/revisions"}],"wp:attachment":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/media?parent=163662"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/categories?post=163662"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/tags?post=163662"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}