4 de agosto de 2026
# El efecto cobra en las métricas de IA

En Delhi, a principios del siglo XX, la administración británica tenía un problema con las cobras. Se les ocurrió pagar una recompensa por cada cobra muerta y funcionó de maravilla: empezaron a llegar cobras muertas a montones. Lo que estaba pasando en realidad es que la gente empezó a criarlas en casa para cobrar la recompensa. Cuando cancelaron el programa, los criadores soltaron a los bichos, que ya no valían nada, y la ciudad se quedó con más cobras que al principio.
La historia la popularizó el economista Horst Siebert y no está nada claro que ocurriera de verdad así, pero el nombre se ha quedado. Efecto cobra: premias una medida y el sistema se pone a producir esa medida, no el resultado que buscabas.
> [!tip] Efecto cobra
> #### Premias una medida y el sistema se pone a producir esa medida, no el resultado que buscabas.
En reuniones con clientes sobre este tema muchas veces acabamos mirando el mismo cuadro de mando. Licencias activadas, usuarios registrados, número de prompts, agentes creados. Todo con flecha verde hacia arriba, y casi todo eso son cobras.
## Por qué acabamos midiendo la velocidad

Esto no pasa porque nadie sea tonto. Pasa porque hay cosas que se dejan medir y cosas que no.
Si Copilot me hace el acta de una reunión, yo sé perfectamente lo que me habría costado hacerla a mano: veinte o treinta minutos, y eso no admite discusión. Ahora decidme cuánto vale esto otro: En un despacho grande me contaron el caso de un abogado que le pasa a un agente los documentos y la información de un juicio. Luego se tira dos horas discutiendo con la IA la argumentación y estrategia. Cuando está conforme, cierra el portátil y se va a la vista. No genera ni un documento. El resultado de la IA es lo que el abogado se lleva en la cabeza después de un par de horas de conversación. Yo no sé medir eso, y no conozco a nadie que sepa.
Entonces pasa lo de siempre. La calidad del trabajo es dificilísima de medir y la velocidad es muy fácil. Por esto el cuadro de mando se llena de velocidad, de cobras.
## Esto no lo ha inventado la IA

Yo he trabajado varios años con CRMs y los CRMs funcionan mal por exactamente lo mismo. El comercial rellena el CRM porque se lo piden, no porque le ayude a vender más, así que lo rellena el viernes a última hora y con lo mínimo. Luego alguien mira ese CRM y decide cosas con lo que hay dentro. El CRM es una herramienta hecha por y para la empresa, no para la persona que lo usa.
Cambiad el CRM por el cuadro de mando de adopción de IA y tenéis la misma historia con veinte años menos.
## El caso de Klarna

Es uno de los casos que más se cita, y hay que contarlo entero porque casi siempre se cuenta a medias.
En febrero de 2024 Klarna anunció que su asistente de IA había atendido [2,3 millones de conversaciones en un mes](https://www.klarna.com/international/press/klarna-ai-assistant-handles-two-thirds-of-customer-service-chats-in-its-first-month/), dos tercios de su atención al cliente, haciendo el trabajo de 700 agentes. El tiempo de resolución bajó de once minutos a menos de dos. Casi todo eso estaba medido de verdad, salvo los 40 millones de dólares de mejora que anunciaron, que eran una estimación suya.
En mayo de 2025 el consejero delegado [le dijo a Bloomberg](https://www.bloomberg.com/news/articles/2025-05-08/klarna-turns-from-ai-to-real-person-customer-service) que se habían pasado. Sus palabras fueron que se habían centrado demasiado en el coste y que el resultado había sido peor calidad, y anunció que iban a contratar gente para que el cliente siempre tenga la opción de hablar con una persona.
Klarna ha desmentido varias veces que esto sea una marcha atrás con la IA, y yo creo que tienen razón. Me quedo con lo otro: optimizaron por la métrica que tenían delante, que era el coste, y se llevaron por delante la calidad, que no estaba mirando nadie y que pesa igual o más.
Fijaos en que las dos cosas pueden ser ciertas a la vez. El tiempo de resolución bajó de verdad. Y me da la sensación, aunque esto ya es cosecha mía, de que un cliente que se rinde y cuelga también baja el tiempo medio de resolución. Es lo mismo que contábamos en [[Posts/2026.06/11-El-cuello-de-botella-siempre-se-muda|el cuello de botella siempre se mueve]]: aprietas donde puedes medir y el problema aparece en el sitio donde no estabas mirando.
## Cuando la métrica es una encuesta

Hay otra cobra más difícil de ver todavía.
En 2025, METR, una organización sin ánimo de lucro que se dedica a medir capacidades de modelos, montó un experimento con 16 desarrolladores veteranos de proyectos de código abierto. 246 tareas reales de sus propios proyectos, sorteadas entre poder usar IA y no poder usarla. El resultado fue que [con IA tardaban un 19% más](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/). Y ahora la parte buena: después de haberlo vivido, esos mismos desarrolladores calculaban que la IA les había acelerado un 20%.
Casi cuarenta puntos entre lo que sentían y lo que estaba pasando.
Ojo con este dato, que se ha citado muchísimo y ya está viejo. Es de principios de 2025, con las herramientas de entonces, y los propios investigadores de METR avisan de que no refleja lo de ahora. Lo que no ha envejecido es lo otro: **preguntarle a la gente cuánto le ha acelerado la IA da una respuesta poco fiable**. Y si os fijáis, casi todas las cifras de productividad de IA que se enseñan en una presentación salen exactamente de ahí, de encuestas a usuarios entusiastas.
## Qué miraría yo

No tengo una lista de métricas buenas para daros, y desconfío bastante del que la tenga. Pero sí hay tres cosas que hago cuando me lo preguntan.
La primera es casi una trampa y es la que más me gusta. Vais al equipo que lleva meses usando IA y le decís que se lo vais a quitar. No se lo quitáis, se lo decís. La cara que ponen vale más que cualquier encuesta, porque ahí no hay nada que inflar.
La segunda es que la métrica exista de antes. Si para demostrar que la IA funciona hay que inventarse un indicador que en la empresa no existía hace dos años, mala señal.
El ejemplo típico son las horas ahorradas. Suena muy bien y se cuenta fácil, pero en una empresa grande ese tiempo casi nunca se convierte en dinero, porque prácticamente todo el mundo tiene ya más trabajo del que puede sacar. Le devuelves dos horas a la semana a alguien que iba con tres de retraso. Está mejor y trabaja con menos carga mental, que no es poca cosa, pero eso no aparece en ninguna casilla de la cuenta de resultados. Los indicadores buenos son los aburridos de siempre, los que ya estaban: días de cierre contable, reclamaciones que se resuelven a la primera, propuestas que se ganan, plazo desde que entra un expediente hasta que sale. Si la IA sirve, esos se deberían mover. Y si no se mueven, hay algo que mirar.
La tercera es asumir que una parte no se va a poder medir, y no maquillarla. El abogado de las dos horas es valor de verdad y no tiene número. Ponerle uno inventado para que el cuadro de mando quede completo es criar cobras.
Habrá que crear métricas nuevas, seguramente. Aprender a medir aspectos que no sabemos medir porque nunca antes se ha hecho. Y porque no teníamos una tecnología comparable a la IA generativa. Pero eso lo dejaría para el final.
## El segundo intento de METR

Termino con lo que a mí me parece la mejor noticia de todo esto.
METR quiso repetir el experimento y montó una segunda tanda en agosto de 2025, con 57 desarrolladores en vez de 16 y con las herramientas nuevas. No les salió. Cada vez más desarrolladores se niegan a participar porque no quieren hacer la mitad de su trabajo sin IA, y los que entran eligen para el experimento las tareas donde menos les duele renunciar a ella. Entre un 30% y un 50% lo reconoció al preguntarles. Uno lo explicó así: hacerlo a la antigua es como cruzar la ciudad andando cuando ya te has acostumbrado a pedir un Uber.
Con lo cual en febrero de este año [han publicado que no se fían de su propio número](https://metr.org/blog/2026-02-24-uplift-update/) y que van a rediseñar el estudio. Y conviene contarlo entero, porque lo que les salió en bruto esta vez es aceleración y no frenazo: un 18% más rápidos los que repetían y un 4% los nuevos. Ellos creen que hoy la IA sí acelera de verdad. Lo que dicen es que no saben cuánto, y que su propio número se queda corto.
O sea que la gente más cuidadosa que hay midiendo esto ha publicado que su cifra no vale, que la cosa probablemente ha mejorado, y que no sabe cuánto.
A mí eso me da más información que una flecha verde en la casilla de adopción. Aunque reconozco que es mucho más difícil de llevar a un comité.
---
Publicado el 4 de agosto de 2026, [LinkedIn](https://www.linkedin.com/pulse/el-efecto-cobra-en-las-m%25C3%25A9tricas-de-ia-david-hurtado-tor%25C3%25A1n-qp6me), [Substack](https://open.substack.com/pub/davidhurtado/p/el-efecto-cobra-en-las-metricas-de?r=4uyjfg&utm_campaign=post&utm_medium=web&showWelcomeOnShare=true), [X](https://x.com/dhtoran/status/2084539145351840182?s=20)