{"id":164381,"date":"2023-12-19T15:49:32","date_gmt":"2023-12-19T15:49:32","guid":{"rendered":"https:\/\/rbnews247.com\/v1\/economia\/los-investigadores-encuentran-que-gpt-y-otros-modelos-de-ia-no-pueden-analizar-una-presentacion-ante-la-sec\/"},"modified":"2023-12-19T15:49:32","modified_gmt":"2023-12-19T15:49:32","slug":"los-investigadores-encuentran-que-gpt-y-otros-modelos-de-ia-no-pueden-analizar-una-presentacion-ante-la-sec","status":"publish","type":"post","link":"https:\/\/rbnews247.com\/v1\/economia\/los-investigadores-encuentran-que-gpt-y-otros-modelos-de-ia-no-pueden-analizar-una-presentacion-ante-la-sec\/","title":{"rendered":"Los investigadores encuentran que GPT y otros modelos de IA no pueden analizar una presentaci\u00f3n ante la SEC"},"content":{"rendered":"<p> [ad_1]<br \/>\n<\/p>\n<div id=\"RegularArticle-ArticleBody-6\" data-module=\"ArticleBody\" data-test=\"articleBody-2\" data-analytics=\"RegularArticle-articleBody-6-2\"><span class=\"HighlightShare-hidden\" style=\"top:0;left:0\"\/><\/p>\n<div class=\"InlineImage-imageEmbed\" id=\"ArticleBody-InlineImage-107349148\" data-test=\"InlineImage\">\n<div class=\"InlineImage-wrapper\">\n<div>\n<p>Los cofundadores de Patronus AI, Anand Kannappan y Rebecca Qian<\/p>\n<p>IA patronus<\/p>\n<\/div>\n<\/div>\n<\/div>\n<div class=\"group\">\n<p>Los investigadores de una startup llamada Patronus AI descubrieron que los modelos de lenguaje grandes, similares al que se encuentra en el coraz\u00f3n de ChatGPT, con frecuencia no responden a las preguntas derivadas de las presentaciones de la Comisi\u00f3n de Bolsa y Valores.<\/p>\n<p>Incluso la configuraci\u00f3n del modelo de inteligencia artificial de mejor rendimiento que probaron, el GPT-4-Turbo de OpenAI, cuando estaba armado con la capacidad de leer casi un archivo completo junto con la pregunta, solo obtuvo el 79% de las respuestas correctas en la nueva prueba de Patronus AI, dijeron los fundadores de la compa\u00f1\u00eda. dijo a CNBC.<\/p>\n<p>A menudo, los llamados modelos de lenguaje grande se negaban a responder o \"alucinaban\" cifras y hechos que no estaban en los documentos de la SEC.<\/p>\n<p>\"Ese tipo de tasa de rendimiento es absolutamente inaceptable\", dijo el cofundador de Patronus AI, Anand Kannappan.  \"Tiene que ser mucho m\u00e1s alto para que realmente funcione de forma automatizada y lista para la producci\u00f3n\".<\/p>\n<p>Los hallazgos resaltan algunos de los desaf\u00edos que enfrentan los modelos de IA a medida que las grandes empresas, especialmente en industrias reguladas como las financieras, buscan incorporar tecnolog\u00eda de punta en sus operaciones, ya sea para servicio al cliente o investigaci\u00f3n.<\/p>\n<p>La capacidad de extraer n\u00fameros importantes r\u00e1pidamente y realizar an\u00e1lisis de narrativas financieras se ha considerado una de las aplicaciones m\u00e1s prometedoras para los chatbots desde que se lanz\u00f3 ChatGPT a fines del a\u00f1o pasado.  Los documentos presentados ante la SEC est\u00e1n llenos de datos importantes, y si un robot pudiera resumirlos con precisi\u00f3n o responder r\u00e1pidamente preguntas sobre su contenido, podr\u00eda darle al usuario una ventaja en la competitiva industria financiera.<\/p>\n<p>El a\u00f1o pasado, Bloomberg LP desarroll\u00f3 <a href=\"https:\/\/www.cnbc.com\/2023\/04\/13\/bloomberg-plans-to-integrate-gpt-style-ai-into-its-terminal.html\">su propio modelo de IA para datos financieros<\/a>profesores de escuelas de negocios <a href=\"https:\/\/www.cnbc.com\/2023\/04\/12\/chatgpt-may-be-able-to-predict-stock-movements-finance-professor-says.html\">investigado<\/a> si ChatGPT puede analizar titulares financieros, y <span class=\"QuoteInBody-quoteNameContainer\" data-test=\"QuoteInBody\" id=\"RegularArticle-QuoteInBody-3\"><a href=\"https:\/\/www.cnbc.com\/quotes\/JPM\/\">JPMorgan<\/a><span class=\"QuoteInBody-inlineButton\"><span class=\"AddToWatchlistButton-watchlistContainer\" id=\"-WatchlistDropdown\" data-analytics-id=\"-WatchlistDropdown\"><button class=\"AddToWatchlistButton-watchlistButton\" aria-label=\"Add To Watchlist\" data-testid=\"dropdown-btn\"><span class=\"AddToWatchlistButton-addWatchListFromTag\"\/><\/button><\/span><\/span><\/span>  est\u00e1 trabajando en una herramienta de inversi\u00f3n automatizada impulsada por IA, <a href=\"https:\/\/www.cnbc.com\/2023\/05\/25\/jpmorgan-develops-ai-investment-advisor.html\">CNBC inform\u00f3 anteriormente<\/a>.  La IA generativa podr\u00eda impulsar la industria bancaria en billones de d\u00f3lares al a\u00f1o, seg\u00fan un estudio reciente <a href=\"https:\/\/www.cnbc.com\/2023\/12\/18\/generative-ai-has-landed-on-wall-street-heres-how-it-can-help-propel-massive-revenue-growth-.html?__source=sharebar%7Ctwitter&amp;amp;par=sharebar\">Dijo el pron\u00f3stico de McKinsey.<\/a><\/p>\n<p>Pero la entrada de GPT en la industria no ha sido f\u00e1cil.  Cuando <span class=\"QuoteInBody-quoteNameContainer\" data-test=\"QuoteInBody\" id=\"RegularArticle-QuoteInBody-6\"><a href=\"https:\/\/www.cnbc.com\/quotes\/MSFT\/\">microsoft<\/a><span class=\"QuoteInBody-inlineButton\"><span class=\"AddToWatchlistButton-watchlistContainer\" id=\"-WatchlistDropdown\" data-analytics-id=\"-WatchlistDropdown\"><button class=\"AddToWatchlistButton-watchlistButton\" aria-label=\"Add To Watchlist\" data-testid=\"dropdown-btn\"><span class=\"AddToWatchlistButton-addWatchListFromTag\"\/><\/button><\/span><\/span><\/span>  lanz\u00f3 por primera vez su Bing Chat utilizando GPT de OpenAI, uno de sus principales ejemplos fue el uso del chatbot para resumir r\u00e1pidamente un comunicado de prensa de ganancias.  Los observadores r\u00e1pidamente se dieron cuenta de que los n\u00fameros en el ejemplo de Microsoft <a href=\"https:\/\/www.cnbc.com\/2023\/02\/14\/microsoft-bing-ai-made-several-errors-in-launch-demo-last-week-.html\">estaban fuera<\/a>y algunos n\u00fameros fueron inventados por completo.<\/p>\n<\/div>\n<h2 class=\"ArticleBody-subtitle\"><a id=\"headline0\"\/>&#8217;Controles de vibraciones'<\/h2>\n<div class=\"group\">\n<p>Parte del desaf\u00edo al incorporar LLM en productos reales, dicen los cofundadores de Patronus AI, es que los LLM no son deterministas: no se garantiza que produzcan el mismo resultado cada vez con la misma entrada.  Eso significa que las empresas necesitar\u00e1n realizar pruebas m\u00e1s rigurosas para asegurarse de que est\u00e9n funcionando correctamente, sin salirse del tema y proporcionando resultados confiables.<\/p>\n<p>Los fundadores se reunieron en la empresa matriz de Facebook <span class=\"QuoteInBody-quoteNameContainer\" data-test=\"QuoteInBody\" id=\"RegularArticle-QuoteInBody-8\"><a href=\"https:\/\/www.cnbc.com\/quotes\/META\/\">Meta<\/a><span class=\"QuoteInBody-inlineButton\"><span class=\"AddToWatchlistButton-watchlistContainer\" id=\"-WatchlistDropdown\" data-analytics-id=\"-WatchlistDropdown\"><button class=\"AddToWatchlistButton-watchlistButton\" aria-label=\"Add To Watchlist\" data-testid=\"dropdown-btn\"><span class=\"AddToWatchlistButton-addWatchListFromTag\"\/><\/button><\/span><\/span><\/span>, donde trabajaron en problemas de IA relacionados con comprender c\u00f3mo los modelos obtienen sus respuestas y hacerlos m\u00e1s \"responsables\".  Fundaron Patronus AI, que recibi\u00f3 financiaci\u00f3n inicial de Lightspeed Venture Partners, para automatizar las pruebas de LLM con software, de modo que las empresas puedan sentirse c\u00f3modas de que sus robots de IA no sorprender\u00e1n a los clientes o trabajadores con respuestas incorrectas o fuera de tema.<\/p>\n<p>\"En este momento la evaluaci\u00f3n es en gran medida manual. Se siente como simplemente probar mediante inspecci\u00f3n\", dijo Rebecca Qian, cofundadora de Patronus AI.  \"Una empresa nos dijo que se trataba de 'controles de vibraciones'\".<\/p>\n<p>Patronus AI trabaj\u00f3 para escribir un conjunto de m\u00e1s de 10.000 preguntas y respuestas extra\u00eddas de presentaciones ante la SEC de importantes empresas que cotizan en bolsa, a las que llama FinanceBench.  El conjunto de datos incluye las respuestas correctas y tambi\u00e9n d\u00f3nde encontrarlas exactamente en un archivo determinado.  No todas las respuestas se pueden extraer directamente del texto y algunas preguntas requieren c\u00e1lculos o razonamiento ligeros.<\/p>\n<p>Qian y Kannappan dicen que es una prueba que proporciona un \"est\u00e1ndar m\u00ednimo de rendimiento\" para la IA del lenguaje en el sector financiero.<\/p>\n<p>A continuaci\u00f3n se muestran algunos ejemplos de preguntas en el conjunto de datos, proporcionado por Patronus AI:<\/p>\n<ul>\n<li>\u00bfCVS Health pag\u00f3 dividendos a los accionistas comunes en el segundo trimestre del a\u00f1o fiscal 2022?<\/li>\n<li>\u00bfAMD inform\u00f3 concentraci\u00f3n de clientes en el a\u00f1o fiscal 22?<\/li>\n<li>\u00bfCu\u00e1l es el margen% de COGS del a\u00f1o fiscal 2021 de Coca Cola?  Calcule lo que se pidi\u00f3 utilizando las partidas que se muestran claramente en el estado de resultados.<\/li>\n<\/ul>\n<\/div>\n<h2 class=\"ArticleBody-subtitle\"><a id=\"headline1\"\/>C\u00f3mo les fue a los modelos de IA en la prueba<\/h2>\n<div class=\"group\">\n<p>Patronus AI prob\u00f3 cuatro modelos de lenguaje: GPT-4 y GPT-4-Turbo de OpenAI, Claude 2 de Anthropic y Llama 2 de Meta, utilizando un subconjunto de 150 de las preguntas que hab\u00eda producido.<\/p>\n<p>Tambi\u00e9n prob\u00f3 diferentes configuraciones e indicaciones, como una configuraci\u00f3n en la que a los modelos OpenAI se les daba el texto fuente relevante exacto en la pregunta, al que llam\u00f3 modo \"Oracle\".  En otras pruebas, a los modelos se les dijo d\u00f3nde se almacenar\u00edan los documentos subyacentes de la SEC, o se les dio un \"contexto extenso\", lo que signific\u00f3 incluir casi una presentaci\u00f3n completa de la SEC junto con la pregunta en el mensaje.<\/p>\n<p>GPT-4-Turbo fall\u00f3 en la prueba de \"libro cerrado\" de la startup, donde no se le dio acceso a ning\u00fan documento fuente de la SEC.  No respondi\u00f3 al 88% de las 150 preguntas que se le hicieron y solo dio una respuesta correcta 14 veces.<\/p>\n<p>Pudo mejorar significativamente cuando se le dio acceso a las presentaciones subyacentes.  En el modo \"Oracle\", donde se se\u00f1alaba el texto exacto de la respuesta, GPT-4-Turbo respondi\u00f3 la pregunta correctamente el 85% de las veces, pero aun as\u00ed produjo una respuesta incorrecta el 15% de las veces.<\/p>\n<p>Pero esa es una prueba poco realista porque requiere intervenci\u00f3n humana para encontrar el lugar exacto y pertinente en el archivo, la tarea exacta que muchos esperan que los modelos de lenguaje puedan abordar.<\/p>\n<p>Llama 2, un modelo de IA de c\u00f3digo abierto desarrollado por Meta, tuvo algunas de las peores \"alucinaciones\", produciendo respuestas incorrectas hasta el 70% de las veces y respuestas correctas s\u00f3lo el 19% de las veces, cuando se le daba acceso a una matriz. de los documentos subyacentes.<\/p>\n<p>Claude 2 de Anthropic tuvo un buen desempe\u00f1o cuando se le dio un \"contexto extenso\", donde se incluy\u00f3 casi toda la presentaci\u00f3n relevante de la SEC junto con la pregunta.  Pudo responder el 75% de las preguntas que le formularon, dio una respuesta incorrecta al 21% y no respondi\u00f3 solo al 3%.  A GPT-4-Turbo tambi\u00e9n le fue bien con el contexto largo, respondiendo correctamente el 79% de las preguntas y dando la respuesta incorrecta en el 17% de ellas.<\/p>\n<p>Despu\u00e9s de realizar las pruebas, los cofundadores se sorprendieron de lo mal que funcionaron los modelos, incluso cuando se les indic\u00f3 d\u00f3nde estaban las respuestas.<\/p>\n<p>\"Una cosa sorprendente fue la frecuencia con la que los modelos se negaron a responder\", dijo Qian.  \"La tasa de rechazo es realmente alta, incluso cuando la respuesta est\u00e1 dentro del contexto y un humano ser\u00eda capaz de responderla\".<\/p>\n<p>Sin embargo, incluso cuando los modelos funcionaron bien, simplemente no fueron lo suficientemente buenos, descubri\u00f3 Patronus AI.<\/p>\n<p>\"Simplemente no hay un margen de error que sea aceptable porque, especialmente en las industrias reguladas, incluso si el modelo obtiene la respuesta incorrecta 1 de cada 20 veces, todav\u00eda no es una precisi\u00f3n suficientemente alta\", dijo Qian.<\/p>\n<p>Pero los cofundadores de Patronus AI creen que existe un enorme potencial para que los modelos de lenguaje como GPT ayuden a las personas en la industria financiera (ya sean analistas o inversores) si la IA contin\u00faa mejorando.<\/p>\n<p>\"Definitivamente pensamos que los resultados pueden ser bastante prometedores\", afirm\u00f3 Kannappan.  \"Los modelos seguir\u00e1n mejorando con el tiempo. Tenemos muchas esperanzas de que, a largo plazo, mucho de esto pueda automatizarse. Pero hoy, definitivamente necesitar\u00e1s tener al menos un ser humano al tanto para ayudar a apoyar y guiar. cualquier flujo de trabajo que tengas.\"<\/p>\n<p>Un representante de OpenAI se\u00f1al\u00f3 la <a href=\"https:\/\/openai.com\/policies\/usage-policies\" target=\"_blank\" rel=\"noopener\">pautas de uso de la empresa<\/a>, que proh\u00edben ofrecer asesoramiento financiero personalizado utilizando un modelo OpenAI sin que una persona calificada revise la informaci\u00f3n, y requieren que cualquier persona que utilice un modelo OpenAI en la industria financiera proporcione un descargo de responsabilidad inform\u00e1ndoles que se est\u00e1 utilizando IA y sus limitaciones.  Las pol\u00edticas de uso de OpenAI tambi\u00e9n dicen que los modelos de OpenAI no est\u00e1n ajustados para brindar asesoramiento financiero.<\/p>\n<p>Meta no respondi\u00f3 de inmediato a una solicitud de comentarios y Anthropic no hizo comentarios de inmediato.<\/p>\n<p><em><strong>No te pierdas estas historias de CNBC PRO:<\/strong><\/em><\/p>\n<\/div>\n<\/div>\n<p>[ad_2]<br \/>\n<br \/><a href=\"https:\/\/www.cnbc.com\/2023\/12\/19\/gpt-and-other-ai-models-cant-analyze-an-sec-filing-researchers-find.html\">Source link <\/a><\/p>\n","protected":false},"excerpt":{"rendered":"<p>[ad_1] Los cofundadores de Patronus AI, Anand Kannappan y Rebecca Qian IA patronus Los investigadores de una startup llamada Patronus AI descubrieron que los modelos de lenguaje grandes, similares al que se encuentra en el coraz\u00f3n de ChatGPT, con frecuencia no responden a las preguntas derivadas de las presentaciones de la Comisi\u00f3n de Bolsa y [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":164382,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_et_pb_use_builder":"","_et_pb_old_content":"","_et_gb_content_width":"","footnotes":""},"categories":[1176],"tags":[11200,812,783,1806,6863,6463,808,2703,3543,385,3550,3539],"class_list":["post-164381","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-economia","tag-apple-inc-t-jpmorgan-drn","tag-ciencia","tag-empresa","tag-mercados","tag-meta-platforms-inc","tag-microsoft-corp","tag-movil","tag-negocios","tag-noticias-de-negocios","tag-tecnologia","tag-ultimas-noticias-mercados","tag-ultimas-noticias-tecnologia","et-has-post-format-content","et_post_format-et-post-format-standard"],"_links":{"self":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/posts\/164381","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/comments?post=164381"}],"version-history":[{"count":0,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/posts\/164381\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/media\/164382"}],"wp:attachment":[{"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/media?parent=164381"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/categories?post=164381"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/rbnews247.com\/v1\/wp-json\/wp\/v2\/tags?post=164381"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}