La muerte de los Chatbots
(y eso no significa que vayas a dejar de utilizarlos)
Buenos días de lunes 🤙
Desde que empecé en la universidad a estudiar mates me gustan los lunes, por eso decidí que iba a enviar la newsletter este día. No es muy común ser amigo de los lunes, pero aquí estamos, una semana más.
La verdad que cuando escribí el título de esta semana, sonaba dramático. Incluso un poco falso, te diría.
Es bastante improbable que los chatbots como los conocemos desaparezcan. Pero en el mundo de la IA generativa están muriendo.
¿Significa esto que creo que vamos a dejar de utilizar chatbots?
Para nada.
Lo que vengo a contarte es que aunque tú todavía sigas abriendo ChatGPT, Claude, Perplexity, Gemini o la que sea y escribas en una cajita de texto, por detrás pasan muchas cosas.
Desde fuera todo parece igual, pero detrás ya no hay un modelo de lenguaje que continúa el texto que has escrito. Hay una capa de acceso a esos modelos de lenguaje, procesamiento de tu texto, herramientas, memoria, archivos, permisos, conectores…
La diferencia es sutil, pero realmente importante. Las empresas trabajan en mejorar la interfaz, ponerlo todo más fácil, más accesible.
Genial.
Esto ya no va solo de conversaciones. Esto va de dar las llaves de tu casa.
El chatbot ha dejado de ser el producto final y ha empezado a ser la puerta de entrada.
ChatGPT, Claude, Gemini no quieren ser conversaciones, quieren leer tus documentos, revisar tu código, preparar informes, ejecutar cosas en tu ordenador y actuar mientras lees esta newsletter, por ejemplo.
Antes cuando un “modelo de IA” cometía un error o alucinaba, se quedaba en tu pantalla.
Ahora, a través de esa cajita de texto y después de un montón de procesos, el error entra en tu sistema.
Por eso, ya no necesitamos el mejor prompt para X, necesitamos adultos funcionales que puedan supervisar todo esto.
Y justo aquí, aparece la fantasía colectiva del momento: un agente IA como empleado del mes.
Un trabajador incansable: el Chuck Norris de los trabajadores. Lo hace todo, no pide vacaciones, no se queja…
Maravilloso.
Hasta que recuerdas que a un empleado normal, no le das todos los accesos de tu empresa el primer día en el onboarding porque te ha dicho en la entrevista que “aprende rápido”.
La pregunta ya no es si puede hacer cosas.
La pregunta es ¿qué pasa cuando lo hace mal? ¿cómo sé que está haciendo algo mal?
El reto es conseguir que todo esto no sea un dolor de cabeza. Toca diseñar entornos para que poner un agente de IA a trabajar no sea un salto de fe.
Y como siempre, lo mejor para todo esto es entender las bases.
Estamos viviendo el cambio de interfaz a infraestructura. Con todas sus ventajas y todos sus riesgos.
Pon tu foco en crear una buena infraestructura de trabajo para este nuevo empleado que, sí o sí vas a tener meter en tu empresa.
Tengo un Déjà Vu con esto. En 2016, recuerdo que Gartner (una empresa de investigación y consultoría) publicó un análisis de mercado que decía algo así: “La mayoría de proyectos de big data fracasa”
Estimaba que el 60% de este tipo de proyectos eran un fracaso absoluto. Yo en ese momento lo vivía, mucho caos, poca puesta en producción, poco valor para la empresa.
Para mi las causas estaban claras. Poca madurez, poca formación y mucha prisa por hablar de ello.
Vamos a evitar dar la razón a Marx con esto y aprendamos de nuestros errores.
¿Puedo echarte una mano para entender mejor la IA a ti o tu departamento en la empresa? Responde este correo y lo vemos. Vamos a intentar dejar las cosas un poco mejor…
Dicho esto, vamos con los 4 tokens de la semana:
🧠 El token que me tiene quemando neuronas
Los benchmarks han dejado de ser útiles.
Antes tenían sentido, queríamos comparar qué modelo respondía mejor.
Pero la carrera de los benchmarks ha dejado de tener sentido.
Ahora toca centrarse en: ¿qué sistema con qué modelo puedo dejar trabajando libremente sin que me rompa nada y confiando en el resultado?
Con esta pregunta, los benchmarks públicos se quedan cortos. Hay que hacer evaluaciones propias (que ahora en la jerga actual se llaman evals).
Un benchmark público te dice cómo se comporta un modelo en un examen concreto.
Una evaluación propia te dice si ese modelo es útil para tu caso concreto.
O dicho de otra manera: un benchmark son los estudios de una persona y una evaluación interna es el periodo de prueba para un puesto de trabajo determinado.
Los benchmarks sirven para vender avance.
Las evals sirven para saber si puedes ponerlo en producción.
Toca cambiar la frase: “este modelo es top 1 en MMLU” por algo más adulto responsable.
Este modelo… ¿qué porcentaje de veces hace bien MI tarea, con MI contexto, y qué pasa cuando falla?
📡 El token de actualidad
Te traigo una noticia calentita.
OpenAI va a pagar ChatGPT Plus a toda Malta (durante un año y solo a ciudadanos/residente elegibles)
Te lo traigo porque creo que es un paso importante.
Porque un país está empezando a jugar con el acceso a modelos de IA avanzados como parte de su infraestructura educativa y productiva.
Aunque no es oro todo lo que reluce…
¿Queremos alfabetización en IA o queremos que la gente use el cacharrito de una empresa?
No lo digo como crítica y ya está. La iniciativa puede ser muy útil, pero hay que tener en cuenta los matices.
Si queremos que la IA sea infraestructura no vale solo con accesos, hay que tener alternativas, transparencia y, por supuesto, formación.
Aquí se pone interesante la cosa. Esto ya no va de si tenemos o no una suscripción a ChatGPT, empieza a ser una cuestión educativa, económica y política.
🤣 El meme
(meme generado con inteligencia humana por una inteligencia artificial)
🍿 Un token de lo que estoy consumiendo
Porque no todo tiene que ser Inteligencia Artificial, esta semana he visto un monólogo con mi amigo Bohdan que ha sido realmente increible.
Es de Red Richardson y lo puedes ver en YouTube aquí
Gracias por leer esto, de corazón.
Alfonso Blázquez

