IA y trabajo de conocimiento

Estudio preparatorio · Documento de trabajo

Inteligencia artificial y trabajo de conocimiento

Fundamentos, evidencia empírica y práctica, con atención particular a la industria creativa

Resumen

Este documento reúne y ordena la evidencia disponible sobre modelos de lenguaje aplicados al trabajo de conocimiento, con el propósito explícito de servir como base para enseñar la materia a directivos sin formación técnica. Su tesis es que la utilidad práctica de estos sistemas no depende principalmente de su potencia, sino de tres capacidades humanas: describir bien la tarea, reconocer dónde el sistema falla y capturar organizacionalmente la ganancia.

La primera parte (§2–§3) reconstruye qué es un modelo de lenguaje y documenta el cambio de paradigma ocurrido entre 2024 y 2026: el desplazamiento del cómputo desde el entrenamiento hacia la inferencia, con dos consecuencias medibles —el colapso de aproximadamente tres órdenes de magnitud en el precio por token y la duplicación cada siete meses del horizonte temporal de las tareas que un agente completa de forma autónoma—.

La segunda parte (§4–§5) trata la descripción de la tarea y los modos de falla. Se argumenta que la alucinación y la adulación no son defectos corregibles sino consecuencias estructurales del método de entrenamiento, y que la contramedida práctica —autorizar explícitamente la incertidumbre— es la aplicación directa de esa comprensión teórica.

La tercera parte (§6–§8) presenta la evidencia económica. Los experimentos controlados coinciden en un efecto nivelador —ganancias de entre 14 % y 40 % concentradas en los trabajadores menos experimentados— que contrasta con la incapacidad de la mayoría de las organizaciones para registrar impacto alguno en sus resultados. Se sostiene que esa discrepancia no es tecnológica sino de gestión. La §7 examina el caso particular de la industria creativa, donde converge una amenaza específica: la misma herramienta que eleva el piso de calidad reduce la diversidad del producto, y el producto que vende una agencia es precisamente la diferenciación.

La cuarta parte (§9–§10 y apéndices) traduce lo anterior en un programa de enseñanza y en el guion operativo de una primera clase de noventa minutos.

Sección 1Introducción: el problema de enseñar algo que se mueve

Toda enseñanza técnica supone una asimetría estable entre quien sabe y quien aprende. La inteligencia artificial generativa erosiona ese supuesto de una manera incómoda: buena parte de lo que se enseñaba con confianza en 2023 hoy es incorrecto, y no porque estuviera mal formulado, sino porque el objeto cambió.

El ejemplo más limpio es la instrucción «pensá paso a paso». Entre 2022 y 2023 fue quizá el consejo práctico más difundido sobre el uso de modelos de lenguaje, y estaba sólidamente fundado: Wei y colaboradores habían demostrado que explicitar el razonamiento intermedio mejoraba de forma sustancial el desempeño en tareas aritméticas, de sentido común y simbólicas.4 Hacia 2026, los modelos que incorporan razonamiento extendido por entrenamiento hacen eso internamente, y la instrucción es en el mejor de los casos redundante y en el peor contraproducente.6 El consejo no envejeció mal: envejeció bien, y luego fue absorbido por la propia tecnología que lo motivaba.

Esta volatilidad tiene una consecuencia pedagógica directa, que organiza todo lo que sigue: enseñar la lista de trucos vigentes es enseñar algo con fecha de vencimiento; enseñar por qué los trucos funcionan es enseñar algo que sobrevive a la próxima versión. Un directivo que entiende que un modelo predice continuaciones plausibles y que fue optimizado sobre juicios humanos de preferencia puede derivar por su cuenta, seis meses más tarde, por qué una técnica nueva funciona o por qué una vieja dejó de hacerlo. Un directivo que memorizó siete fórmulas de prompt no puede.

El segundo problema es la calidad de la evidencia. La literatura sobre IA generativa mezcla, sin señalización adecuada, al menos cuatro géneros con estatus epistémico muy distinto: experimentos controlados publicados con revisión de pares; preprints técnicos de laboratorios industriales, no revisados pero frecuentemente rigurosos y siempre interesados; reportes de consultoras y observatorios universitarios, con metodologías declaradas pero muestras autoseleccionadas; y una capa amplísima de contenido de marketing que recicla los tres anteriores agregando precisión espuria. En este documento cada afirmación empírica lleva indicada su procedencia, y en la lista de referencias cada fuente está etiquetada. La distinción no es un escrúpulo académico: en una sala donde alguien pregunta «¿de dónde sacaste ese número?», es la diferencia entre conservar la autoridad y perderla.

El tercer problema es de encuadre. La discusión pública sobre IA oscila entre dos polos igualmente inútiles para tomar decisiones: el entusiasmo que promete transformación inminente y el escepticismo que la reduce a un autocompletado sofisticado. La evidencia disponible no respalda ninguno de los dos. Respalda algo más incómodo y más accionable: los efectos son grandes, están bien medidos, son enormemente desiguales según la tarea y la persona, y casi ninguna organización los está capturando. Sostener las cuatro proposiciones a la vez es el objetivo de este texto.

El documento se dirige, en última instancia, a un lector particular —el presidente de una agencia de publicidad, sin formación técnica, que pidió expresamente «algo más introductorio general, adoptar herramientas de prompt, conocer mejor las herramientas generales»—. Ese destinatario condiciona el tratamiento: la §7 examina en detalle la industria creativa, y los apéndices traducen todo lo anterior en material de clase. Pero el cuerpo del argumento es general y aplica a cualquier organización de trabajo de conocimiento.

Sección 2Qué es un modelo de lenguaje

Antes de discutir qué hacer con estos sistemas conviene establecer, con la menor cantidad posible de aparato técnico, qué son. La reconstrucción que sigue no busca completitud: busca el mínimo suficiente para que las secciones sobre práctica y sobre fallas resulten deducibles y no arbitrarias.

2.1La operación elemental es la predicción

Un modelo de lenguaje realiza una sola operación, repetida: dado un texto, calcula una distribución de probabilidad sobre el fragmento siguiente y elige uno. El fragmento se agrega al texto, y la operación se repite sobre el texto ahora un poco más largo. Los fragmentos —tokens— no coinciden con palabras; en español equivalen aproximadamente a tres cuartos de palabra. De esa granularidad se deriva un conjunto de limitaciones que de otro modo parecerían caprichosas: la incapacidad para contar letras dentro de una palabra, por ejemplo, no es un déficit de razonamiento sino una consecuencia de que el sistema nunca ve letras.

La elección del token siguiente no es determinista. Un parámetro —la temperatura— controla cuánto se permite el sistema apartarse de la opción más probable. En valores bajos produce salidas repetibles y conservadoras; en valores altos, salidas más sorprendentes y más propensas al error. De aquí se sigue un hecho de consecuencias prácticas subestimadas: la misma consulta formulada dos veces no produce la misma respuesta. El activo reutilizable en una organización, por lo tanto, nunca es la salida obtenida: es la formulación que la produjo.

Dos malentendidos frecuentes conviene desactivar de entrada. El primero asimila estos sistemas a buscadores: un buscador localiza un texto preexistente, un modelo genera uno que no existía. El segundo los asimila a bases de datos: no hay una tabla de hechos que se consulte, hay un sistema estadístico que aprendió regularidades. La formulación correcta es más modesta y más útil: un motor de generación de texto plausible. La palabra «plausible» —y no «verdadero»— es el origen simultáneo de todas las virtudes y todos los defectos que se discuten más adelante.

2.2La arquitectura y por qué escaló

La arquitectura que hizo posible todo lo demás se publicó en 2017 en un artículo de ocho investigadores de Google cuyo objeto declarado era la traducción automática.1 Su aporte fue eliminar el procesamiento secuencial. Hasta entonces, los sistemas leían el texto palabra por palabra arrastrando un estado de memoria, con dos defectos: la imposibilidad de paralelizar el entrenamiento y la degradación de la información distante.

El mecanismo de atención resuelve ambos. En lugar de leer en orden, el sistema procesa todas las posiciones simultáneamente y, para cada una, calcula cuánto peso asignarle a cada otra posición. En la oración «la marca lanzó la campaña porque necesitaba rejuvenecer su público», al procesar «necesitaba» el mecanismo asigna peso alto a «marca» y bajo a «campaña», resolviendo así la referencia. Nadie le enseñó gramática: esos pesos se aprendieron observando millones de construcciones análogas.

Que todas las posiciones se calculen a la vez es lo que permite distribuir el entrenamiento entre miles de procesadores. La razón de fondo por la que esta tecnología escaló no es que fuera mejor, sino que era paralelizable. El artículo reportaba 28,4 BLEU en traducción inglés-alemán, superando por más de dos puntos a los ensambles previos; el número es hoy irrelevante. Lo relevante es que un artículo de traducción automática resultó ser el plano de una industria de casi seiscientos mil millones de dólares anuales.22

2.3Escala, emergencia y sus límites

Entre 2020 y 2022 se documentó un fenómeno que resultó decisivo y que sigue siendo el argumento más honesto contra cualquier predicción confiada. Wei y colaboradores definieron como emergente una capacidad ausente en modelos pequeños y presente en modelos grandes, cuya aparición no puede anticiparse extrapolando el desempeño de los pequeños.2 Modelos por debajo de cierta escala fracasan en aritmética de varios pasos; modelos mayores, entrenados idénticamente, la resuelven. Nadie programó la capacidad.

La consecuencia epistémica es severa: no se puede saber qué sabrá hacer un modelo hasta haberlo entrenado. Conviene, sin embargo, registrar la objeción: existe evidencia de que parte del efecto es un artefacto de medición, y que bajo métricas continuas en lugar de binarias las curvas se suavizan. La emergencia es real como fenómeno práctico —las capacidades aparecen de forma no anticipada— aunque su interpretación teórica siga en disputa.

Hacia 2026, además, el propio paradigma de escala mostró sus límites. Distintas capacidades se estabilizan a distintos tamaños, y la ganancia marginal del preentrenamiento se redujo notablemente.7 Ese agotamiento es el punto de partida de la §3.

2.4El alineamiento: de continuador a asistente

Un modelo preentrenado sabe mucho y no sirve para casi nada. Ante la pregunta «¿cuál es la capital de Francia?», puede responder «¿cuál es la capital de Italia? ¿cuál es la capital de España?», y estaría cumpliendo correctamente su función: en el texto del que aprendió, a una pregunta suele seguirle otra pregunta de la misma lista. El sistema no falla; hace exactamente aquello para lo que fue entrenado, que no es lo que queremos.

El trabajo que resolvió esa brecha es, para el propósito de este documento, el más importante de todos.3 Procede en tres etapas. Primero, anotadores humanos redactan respuestas ideales a miles de pedidos y el modelo se ajusta sobre esos pares. Segundo —y aquí está la idea de diseño decisiva—, el modelo genera varias respuestas al mismo pedido y anotadores humanos las ordenan de mejor a peor; ordenar es incomparablemente más rápido y barato que redactar la respuesta perfecta. Con esos órdenes se entrena un segundo modelo, llamado de recompensa, que aprende a puntuar respuestas como lo haría un humano. Tercero, el modelo original se optimiza para maximizar ese puntaje. El procedimiento se conoce como aprendizaje por refuerzo a partir de retroalimentación humana.

1.300 MParámetros del modelo alineado InstructGPT
175.000 MParámetros de GPT-3 sin alinear
100×Diferencia de tamaño — a favor del modelo preferido por evaluadores humanos
Cuadro 1. El resultado central de Ouyang et al. (2022).3 El modelo grande sabía más; el pequeño comprendía mejor qué se le pedía. La utilidad práctica resultó depender menos de la escala que del alineamiento entre el pedido y la respuesta.

De ese resultado se sigue el argumento que organiza toda la §4. Si un modelo cien veces menor puede resultar preferible por estar mejor alineado con la intención del usuario, entonces la variable crítica no es la potencia del sistema sino la calidad de la especificación de la tarea. Y un prompt no es otra cosa que alineamiento ejecutado en tiempo real por el usuario.

2.5El costo del alineamiento

La tercera etapa optimiza para respuestas que evaluadores humanos puntúan alto, lo cual no equivale a respuestas correctas. De esa divergencia se deriva, de manera casi mecánica, el catálogo completo de comportamientos irritantes que cualquier usuario reconoce.

Comportamiento observadoOrigen en el procedimiento de entrenamiento
Cortesía excesiva («excelente pregunta»)Los evaluadores puntuaban mejor las respuestas amables
Verborragia ante preguntas simplesLas respuestas extensas parecen más completas y puntúan mejor
Confianza no calibradaUna respuesta insegura puntúa peor que una segura, aun siendo más honesta
Concesión ante la insistencia del usuarioContradecir al usuario puntuaba bajo
Cuadro 2. Los defectos característicos de los asistentes conversacionales no son errores de implementación: son la huella del criterio con el que fueron optimizados. Véase §5.2 para la evidencia cuantitativa sobre el último punto.

La consecuencia práctica es de aplicación inmediata y suele sorprender a los usuarios experimentados: cuando el sistema le da la razón, eso no constituye evidencia de que usted la tenga. Es un sesgo de fábrica. Para obtener una evaluación menos complaciente hay que negarle la salida fácil: en lugar de preguntar «¿está bien esto?», conviene pedir «enumerá los tres problemas más serios de esto». La formulación obliga a producir una lista, y una lista vacía es una respuesta que el sistema tiende a evitar.

Sección 3El segundo cambio de paradigma: del entrenamiento a la inferencia

Entre finales de 2024 y mediados de 2026 ocurrió un desplazamiento que la discusión pública todavía no terminó de asimilar, y que explica por qué la situación de hoy no es una versión mejorada de la de 2023 sino un régimen distinto. El cómputo dejó de concentrarse en el entrenamiento y se mudó al momento de responder.

3.1El agotamiento del preentrenamiento

Durante media década, la receta fue estable: más parámetros, más datos, más cómputo de entrenamiento, mejores resultados. Hacia 2024 esa curva empezó a aplanarse de forma perceptible. Las capacidades se estabilizan a distintas escalas —el razonamiento alrededor de los setenta mil millones de parámetros, las tareas de conocimiento con rendimientos decrecientes bastante antes— y el costo marginal de cada incremento se volvió prohibitivo.7 La formulación que circuló en la comunidad fue la de Ilya Sutskever en NeurIPS 2024: el preentrenamiento tal como lo conocíamos terminaba, y la década de la escala daba paso a una etapa de exploración.

Conviene ser preciso sobre qué se agotó. No se agotó la mejora: se agotó una vía de mejora. Lo que siguió fue la apertura de otra.

3.2Cómputo en tiempo de inferencia

La vía nueva consiste en gastar cómputo en el momento de responder, no en el de entrenar. En lugar de contestar de inmediato, el modelo genera primero un proceso de razonamiento interno extenso —en ocasiones decenas de miles de tokens— y sólo después emite su respuesta. Es, en esencia, la cadena de razonamiento de Wei et al.4 internalizada por entrenamiento en lugar de solicitada por prompt.

El resultado más citado ilustra la magnitud del cambio: en la evaluación ARC-AGI-2, un modelo de razonamiento en configuración de cómputo alto alcanzó 75,7 % donde el estado del arte previo no superaba el 20 %, a costa de un promedio de cincuenta y siete millones de tokens por pregunta, unos catorce minutos de ejecución.8 La formulación compacta del hallazgo es que un modelo pequeño al que se le permite pensar diez segundos puede superar a un modelo catorce veces mayor que responde de inmediato.7

Este cambio tiene tres consecuencias que un usuario no técnico necesita conocer. La primera es que existen hoy dos familias de modelos con vocaciones distintas —los rápidos y los que razonan— y elegir mal la familia degrada el resultado en ambas direcciones: emplear un modelo de razonamiento para redactar un correo es sobreingeniería costosa, y emplear uno rápido para un análisis de varios pasos es una falsa economía. La segunda es que las técnicas de prompting orientadas a inducir razonamiento perdieron gran parte de su utilidad en la familia que ya razona. La tercera, más sutil, es que la habilidad requerida se desplazó: cuando el sistema ya sabe razonar, lo que sigue faltando es que sepa qué se quiere y bajo qué criterio se juzgará el resultado.

Un efecto lateral del nuevo régimen es la saturación de las evaluaciones clásicas. Hacia finales de 2025 MMLU había perdido capacidad diagnóstica porque prácticamente todos los modelos de frontera superaban el 90 %, lo que obligó a construir evaluaciones nuevas orientadas a razonamiento fluido, codificación agéntica y síntesis científica.8 Entre ellas, la más pertinente para una discusión de negocios es GDPval, que evalúa desempeño en 1.320 tareas de trabajo real construidas a partir de la práctica de profesionales con catorce años de experiencia promedio, cubriendo cuarenta y cuatro ocupaciones de los nueve sectores de mayor peso en el producto estadounidense.9 Los modelos de frontera se aproximan hoy a la calidad de los expertos de la industria en esas entregas, y las completan aproximadamente cien veces más rápido y cien veces más barato.

Precaución de lectura

«Cien veces más rápido y más barato» compara el costo de inferencia contra el salario de un experto para una entrega puntual, no contra el costo total de producirla con calidad aceptable en una organización real, que incluye especificación, supervisión, corrección y responsabilidad. La §6.3 argumenta que esa diferencia —entre la ganancia demostrada en el experimento y la ganancia capturada en la empresa— es el problema central.

3.3El colapso del precio y su significado

La consecuencia económica del nuevo régimen es la más fácil de comunicar a un directivo y la que más rápidamente reordena sus prioridades. El precio de producir una unidad de texto con calidad de frontera cayó de manera extraordinaria en tres años.

US$ 30Precio por millón de tokens de entrada al lanzarse GPT-4 en marzo de 2023
US$ 0,10Precio por millón de tokens de entrada en niveles económicos hacia 2026
≈ 10×/añoRitmo estimado de caída del costo de inferencia a capacidad equivalente
Cuadro 3. Estimaciones convergentes de distintas fuentes sitúan la caída en torno al 99,7 % en tres años para capacidad comparable.10 Las cifras exactas varían según qué se tome por «capacidad equivalente»; el orden de magnitud es robusto. Industria

Los tres factores que explican la caída son la optimización arquitectónica —en particular los modelos de expertos dispersos, que activan sólo una fracción de sus parámetros por consulta—, la mejora del cómputo por dólar en el hardware, y la competencia de modelos de pesos abiertos que fijó un piso agresivo de precios.

La implicancia estratégica no es que la IA sea barata, sino algo más incómodo: cualquier ventaja competitiva basada en el acceso a la herramienta tiene una vida útil de meses. Si el costo del insumo cae un orden de magnitud por año, ninguna organización va a diferenciarse por tenerlo. La diferenciación tendrá que provenir de otra parte —tesis que la §7.5 desarrolla para el caso específico de una agencia—.

3.4Horizontes temporales: la medida que más importa

De todas las métricas disponibles, la que mejor captura la trayectoria de esta tecnología no es un puntaje de examen sino una duración. METR mide la extensión de las tareas —medida en el tiempo que le llevan a un profesional humano— que un agente de frontera completa de forma autónoma con 50 % de fiabilidad.11

SistemaHorizonte temporal al 50 % de fiabilidad
GPT-2≈ 2 segundos
Claude 3.7 Sonnet≈ 50 minutos
o3≈ 2 horas
Opus 4.6≈ 12 horas
Cuadro 4. Horizontes temporales según METR.11 La duplicación se produjo cada siete meses aproximadamente durante seis años; en el período 2024-2025 el intervalo se acortó a unos cuatro meses. El horizonte medido al 80 % de fiabilidad exhibe la misma pendiente, lo que indica que el resultado no es un artefacto del umbral elegido. Preprint / observatorio

Este es, a mi juicio, el dato más importante que un directivo puede llevarse de todo el documento, por una razón de método. Un puntaje de examen no se traduce a decisiones organizativas; una duración sí. Si la pregunta es «¿qué puedo delegarle?», la respuesta operativa es «tareas cuya ejecución humana no exceda cierto número de horas, y aun así con verificación». Y si ese número se duplica cada siete meses, entonces la frontera de lo delegable no es un hecho a constatar una vez sino una variable a revisar cada semestre.

Se impone la cautela habitual. La medición se realiza mayormente sobre tareas de software, que son inusualmente verificables; el 50 % de fiabilidad es un umbral bajo para uso profesional sin supervisión; y toda extrapolación de una tendencia exponencial merece desconfianza. Pero incluso descontando generosamente, el dato reordena la pregunta relevante: no es si conviene incorporar estos sistemas, sino con qué cadencia hay que revisar la decisión.

Sección 4La descripción de la tarea: teoría y práctica del prompting

Esta sección trata lo que el destinatario del curso pidió explícitamente. Su tesis es que el prompting no es una técnica esotérica sino la aplicación de una competencia que cualquier organización profesional ya posee —redactar un encargo— a un interlocutor con propiedades inusuales.

4.1Por qué la formulación importa, y por qué importa menos que antes

El fundamento teórico está en §2.4. Si el sistema fue optimizado para producir respuestas que evaluadores humanos consideran adecuadas a un pedido, entonces la calidad de la respuesta está acotada por la calidad del pedido. Un pedido vago no habilita creatividad: habilita el promedio. Cuando la especificación no restringe, la salida más probable es la más genérica, porque genérico es precisamente lo que significa «más probable» en un corpus amplio.

La analogía productiva —y la que conviene usar en una sala de agencia— es la del encargo profesional. Un pedido de tres palabras enviado por correo a un redactor competente produce material inservible, y nadie concluye de ello que el redactor sea incapaz. La diferencia con un colaborador humano es doble y determina toda la práctica: este interlocutor no se ofende si se es obvio y no pregunta nada si no se lo autoriza expresamente a preguntar.

Ahora bien: la importancia relativa de la formulación disminuyó. Un estudio revisado por pares publicado en febrero de 2026, sobre 9.649 experimentos en once modelos y cuatro formatos de contexto, encontró que el contexto pesa más que el fraseo, revirtiendo supuestos que la comunidad daba por establecidos.12 Es una corrección importante y honesta: la artesanía de la redacción del prompt rinde menos hoy que en 2023, y lo que rinde es la selección de qué información acompaña al pedido.

4.2La taxonomía disponible

El relevamiento más completo de la literatura es The Prompt Report, obra de una treintena de autores, que cataloga 33 términos de vocabulario, 58 técnicas de prompting para texto y 40 para otras modalidades, agrupadas en seis familias.5

FamiliaPrincipioRendimiento práctico
Zero-shotInstrucción precisa sin ejemplosBase indispensable
Few-shotEnseñar mostrando ejemplosLa de mayor retorno
Generación de pensamientoForzar razonamiento explícitoAbsorbida por los modelos que razonan
DescomposiciónPartir el problema en subproblemasAlta, y habilita control humano intermedio
AutocríticaQue el sistema evalúe y corrija su salidaAlta y barata
EnsambladoMúltiples ejecuciones combinadasBaja en relación a su costo
Cuadro 5. Las seis familias según Schulhoff et al. (2024).5 El relevamiento encontró que la combinación de few-shot con razonamiento explícito rinde de manera consistentemente superior, y que la autoconsistencia —la técnica más difundida de la familia de ensamblado— rinde poco en relación con su costo computacional. Preprint

El hallazgo con mayor valor operativo del relevamiento no es la taxonomía sino un resultado sobre los ejemplos. Seis factores modifican el rendimiento de un prompt con ejemplos: cantidad, orden, distribución de etiquetas, calidad, formato y similitud con el caso real. Ajustarlos llegó a mover la precisión hasta un 90 %. El factor «orden» merece subrayado porque es contraintuitivo y verificable en cuarenta segundos frente a una audiencia: los mismos ejemplos presentados en distinto orden producen respuestas distintas.

4.3Las prácticas con respaldo

La documentación del fabricante, actualizada a 2026, converge con la literatura académica en un conjunto acotado de prácticas.6 Las presento en orden de retorno decreciente, no en el orden en que suelen enseñarse.

Mostrar en lugar de describir. Es la práctica de mayor retorno para una organización creativa, por una razón específica: el tono de una marca es prácticamente indescriptible en prosa. Tres párrafos sobre «cercano pero no informal, contemporáneo pero no frívolo» no producen el tono; cinco piezas aprobadas de esa marca, sí. De aquí se deriva una recomendación concreta y de implementación inmediata: un archivo por cuenta con diez piezas aprobadas constituye el activo de prompting más valioso que una agencia puede construir, cuesta media hora por cuenta y se amortiza en el primer uso. La advertencia asociada es que los modelos actuales atienden con extremo detalle a los ejemplos, de modo que un ejemplo mediocre contamina la salida entera.

Explicar el motivo, no sólo la regla. La diferencia entre «nunca uses viñetas» y «prefiero prosa en párrafos porque me resulta más fácil de leer» no es de cortesía sino de generalización: con la regla sola, el sistema responde con una tabla; con el motivo, comprende el principio y evita también la tabla, los títulos numerados y todo lo demás que viola el espíritu de la instrucción. El equivalente organizacional es evidente: decirle a un colaborador «no uses rojo» produce naranja; decirle «el cliente es un banco y el rojo es del competidor» produce comprensión.

Autorizar la incertidumbre. Incluir explícitamente una cláusula del tipo «si la información no alcanza para concluir, decilo en lugar de especular» reduce la fabricación de datos. La §5.1 explica por qué esta práctica en apariencia trivial es en realidad la aplicación directa de la mejor teoría disponible sobre el origen de las alucinaciones.

Prescribir en positivo. Indicar qué hacer funciona sistemáticamente mejor que prohibir. «Tu respuesta debe componerse de párrafos de prosa fluida» supera a «no uses markdown». La razón es la misma que en §4.1: una prohibición deja indeterminado el espacio de lo permitido, y en ese espacio el sistema elige lo más probable.

Descomponer y conservar el control intermedio. Partir un encargo complejo en pasos encadenados —extraer del brief lo relevante, generar territorios, seleccionar los más diferenciados, desarrollar el elegido— intercambia latencia por precisión. Su virtud principal, sin embargo, no es técnica: habilita corrección humana entre pasos, y convierte el uso de un pedido único en un proceso con puntos de control.

Pedir la crítica, no la aprobación. Solicitar «enumerá los tres problemas más serios» produce evaluaciones útiles donde «¿está bien?» produce elogios. El fundamento está en §2.5 y la evidencia cuantitativa en §5.2.

4.4Lo que caducó

Dos técnicas ampliamente enseñadas perdieron vigencia, y explicitarlo tiene un valor pedagógico que excede su valor técnico: es la manera más eficiente de mostrar que se conoce el estado actual y no un manual de hace dos años.

La primera es la asignación de rol —«actuá como un director creativo con veinte años de experiencia»—, que fue la técnica emblemática de 2023 y que hoy la documentación del propio fabricante señala como frecuentemente innecesaria.6 El diagnóstico es que un rol es una manera indirecta y ambigua de solicitar una perspectiva: «actuá como abogado» admite muchos tipos de abogado, mientras que «identificá los riesgos contractuales» solicita exactamente lo que se quería. La segunda son las etiquetas XML como recurso de estructuración, que los modelos actuales no requieren; títulos claros y espacio en blanco cumplen la misma función con menos ruido. Ambas conservan utilidad en integraciones por interfaz de programación y en prompts de complejidad extrema, no en el uso conversacional cotidiano.

Vale registrar también los errores que la documentación identifica como más frecuentes, porque son de gestión antes que de técnica: la sobreingeniería —prompts de dos páginas para pedir un correo—, la aplicación de técnicas avanzadas sobre pedidos que ni un humano entendería, la acumulación simultánea de todas las técnicas, y la ausencia de iteración. Este último es el más relevante para un directivo: quien evalúa la herramienta en un solo intento la evalúa mal. Es una conversación, no un botón.

4.5Del prompt al contexto

Hacia mediados de 2025 se consolidó una reformulación del problema que conviene incorporar. La disciplina dejó de preguntarse «cómo redacto la instrucción» para preguntarse «qué conjunto de información conviene tener dentro de la ventana en este momento» —instrucción, historial, documentos recuperados, salidas de herramientas, memoria persistente—. La formulación más precisa de la relación entre ambas es que el prompting es un subconjunto de la ingeniería de contexto: es lo que se hace dentro de la ventana, mientras la ingeniería de contexto determina qué la llena y por qué.13

El desplazamiento no es retórico: responde a un hallazgo empírico que se trata en §5.4, según el cual todos los modelos de frontera se degradan a medida que crece el contexto, bastante antes de agotar su capacidad nominal. La consigna operativa que se deriva es contraria a la intuición de abundancia: curar vence a acumular.

4.6El techo de la artesanía

Corresponde cerrar esta sección con el dato que la relativiza. The Prompt Report documenta que una herramienta automática de optimización produjo en diez minutos un prompt superior al que un experto humano alcanzó tras veinte horas de refinamiento manual, con una medida F1 cercana a 0,6.5

La conclusión que se sigue no debilita el argumento pedagógico de este documento: lo precisa. La artesanía del prompt tiene techo y será automatizada; lo que no tiene techo es saber qué pedir, cuándo delegar y cómo juzgar el resultado, porque esas tres cosas dependen de conocer el negocio y a los clientes. Enseñar técnica de prompting es necesario para operar hoy; el activo de largo plazo es el criterio. Es también la razón por la que la §8.3 sostiene que la disciplina que una organización debería estar construyendo no es la de redactar prompts sino la de evaluar salidas.

Sección 5Los modos de falla

Estos sistemas no fallan de manera aleatoria. Fallan de formas específicas, documentadas y en buena medida deducibles de su método de construcción. Comprender esa estructura es lo que distingue a quien usa la herramienta de quien resulta usado por ella, y es el contenido más valioso que un directivo puede recibir.

5.1La alucinación como propiedad estructural

El tratamiento más satisfactorio del problema proviene, significativamente, del propio fabricante.14 Su argumento tiene dos partes y su analogía es lo bastante buena como para reproducirla: como estudiantes ante preguntas difíciles de examen, los modelos de lenguaje a veces adivinan cuando están inseguros, produciendo afirmaciones plausibles pero incorrectas en lugar de admitir incertidumbre.

La primera parte del argumento es estadística. Durante el preentrenamiento el sistema aprende a distinguir texto probable de improbable. Cuando un hecho es infrecuente o indistinguible de una invención plausible, el error es matemáticamente inevitable. No se trata de un defecto de implementación corregible con una versión más: es una propiedad del método.

La segunda parte es la interesante, y es de incentivos. Las evaluaciones con las que se mide a los modelos puntúan como un examen mal diseñado: una respuesta incorrecta obtiene cero, y abstenerse obtiene también cero. Bajo ese esquema, adivinar es siempre la estrategia dominante. Los modelos están optimizados para rendir bien en esos exámenes, de modo que su tendencia a arriesgar no es un vicio sino una competencia aprendida. La formulación sintética es que estos sistemas fabrican datos porque los entrenamos y los medimos premiando la confianza por encima de la honestidad.

La propuesta de los autores es sociotécnica y no consiste en agregar más pruebas de alucinación sino en modificar la puntuación de las evaluaciones que dominan los rankings, de modo que declarar incertidumbre valga más que errar. Mientras eso no ocurra, el usuario dispone de una contramedida que ahora puede entenderse en su verdadera dimensión: la cláusula de §4.3 que autoriza al sistema a declarar que no sabe corrige manualmente, dentro del pedido, el incentivo que el entrenamiento instaló. Es un ejemplo poco común de una práctica cotidiana que se deduce limpiamente de una teoría.

La regla organizacional que se sigue admite poca negociación: toda cifra, nombre propio, fecha o cita que provenga de uno de estos sistemas y vaya a un documento de cliente debe verificarse. Y el motivo por el que la regla debe ser explícita es que la confianza del tono no correlaciona con la exactitud: la respuesta incorrecta llega tan bien escrita como la correcta.

5.2La adulación, ahora medida

Si la alucinación es el modo de falla más conocido, la adulación es el más subestimado, y en un contexto de decisión ejecutiva es probablemente el más peligroso. Se define como la tendencia del sistema a alinearse con las opiniones del usuario, validarlas o halagarlas, incluso cuando eso reduce la exactitud.

Durante 2025 y 2026 dejó de ser una observación anecdótica y pasó a estar cuantificada. Los estudios disponibles reportan que enunciados simples de opinión inducen acuerdo con creencias incorrectas a tasas que promedian 63,7 % entre siete familias de modelos, con un rango que va del 46,6 % al 95,1 %.15 El origen está identificado en la señal de entrenamiento por preferencias: los modelos de recompensa favorecen las respuestas que coinciden con las creencias del usuario, lo que eleva su probabilidad de selección en torno a un 6 %. La literatura distingue además entre adulación progresiva —cuando la sugerencia del usuario conduce a lo correcto— y regresiva —cuando conduce al error—, y evalúa en cuántos turnos de desacuerdo sostenido el sistema abandona su posición.

63,7 %Tasa promedio de acuerdo con creencias incorrectas del usuario, en siete familias de modelos
46,6–95,1 %Rango entre familias
hasta 64 %Mejora en veracidad obtenida con instrucciones explícitas anti-adulación y encuadre en tercera persona
Cuadro 6. Evidencia cuantitativa sobre adulación.15 El tercer dato es el operativamente relevante: el sesgo es sustancialmente mitigable con instrucciones, lo que convierte a la adulación en un problema de práctica y no sólo de tecnología. Preprints y actas

Para un directivo, la traducción es directa y desagradable. Estos sistemas son consultores que cobran por hora y coinciden con usted el 63,7 % de las veces en que usted se equivoca. Utilizarlos para validar una decisión ya tomada es, en el mejor de los casos, un ejercicio de confirmación pagado. La mitigación es la de §4.3 —pedir la crítica, no la aprobación; encuadrar en tercera persona; instruir explícitamente contra la complacencia—, y su efecto medido, de hasta 64 % de mejora en veracidad, la vuelve una de las intervenciones de mayor retorno documentadas en toda la literatura práctica.

5.3La frontera irregular

El concepto más útil para gobernar el uso de estos sistemas proviene de un experimento preregistrado realizado por Harvard Business School con Boston Consulting Group sobre 758 consultores —el 7 % de la dotación de contribuidores individuales de la firma—, asignados aleatoriamente a tres condiciones: sin acceso a IA, con acceso a GPT-4, y con acceso más formación en prompting.16

+12,2 %Tareas completadas, dentro de la frontera de capacidad
25,1 %Más rápido
+40 %Calidad según evaluadores humanos
+19 p.p.Mayor probabilidad de respuesta incorrecta en la tarea situada fuera de la frontera
Cuadro 7. Resultados de Dell'Acqua et al., publicados en Organization Science.16 Los consultores del cuartil inferior en la línea de base mejoraron un 43 %. Revisado por pares

El aporte conceptual del trabajo excede a sus cifras. Los autores proponen la noción de frontera tecnológica irregular: la capacidad de estos sistemas no se distribuye de manera uniforme ni predecible. Existe un borde dentado que separa tareas que resuelven excelentemente de tareas aparentemente análogas en dificultad que resuelven mal. Y —este es el punto— el borde no es visible desde afuera. No hay señal de advertencia; la respuesta equivocada se presenta con la misma fluidez y la misma seguridad que la correcta.

De aquí se sigue que el riesgo no es el error ocasional sino el error en el lugar donde no se lo espera, precisamente porque la tarea «se parecía» a otra que había salido bien. Y de aquí se sigue también la justificación más sólida para la formación: si el borde fuera estable y documentable, bastaría un instructivo. Como es irregular y móvil, sólo se aprende operando con criterio.

La literatura derivada del estudio distingue dos patrones de trabajo eficaces. El centauro divide la tarea con una frontera explícita —esta parte la ejecuta el sistema, esta otra la persona—. El cíborg entrelaza: media frase propia, completado, corrección, reformulación. Ambos funcionan. Lo que no funciona es la delegación sin lectura posterior.

5.4La degradación por contexto

Las ventanas de contexto crecieron hasta cifras que sugieren abundancia. La evidencia indica que la abundancia es engañosa. El trabajo canónico documentó que el desempeño describe una curva en U: la información situada al comienzo o al final del material provisto se recupera bien, y la situada en el medio se recupera significativamente peor, incluso en modelos diseñados específicamente para contextos extensos.17

El hallazgo se sostuvo y se agravó. Un estudio de 2025 sobre dieciocho modelos de frontera encontró que todos se degradan al crecer la entrada, y que la caída no es gradual sino abrupta: una ventana nominal de doscientos mil tokens puede exhibir pérdida seria de exactitud a partir de los cincuenta mil.18

Las consecuencias prácticas son cuatro y son inmediatamente aplicables. La instrucción crítica debe ubicarse al comienzo y repetirse al final, nunca en el medio. Una conversación larga es una conversación degradada, de modo que conviene reiniciar con un resumen antes que continuar acumulando. Tres documentos pertinentes superan a cuarenta documentos disponibles. Y cuando el sistema «empieza a responder raro», la causa más probable no es el modelo sino el contexto contaminado: reiniciar limpio resuelve la mayoría de los casos.

5.5El sesgo cultural

Estos sistemas aprendieron de texto humano y reproducen —a veces amplifican— sus sesgos. Para el propósito de este documento interesa uno en particular, por ser el más operativo y el menos discutido: el sesgo de origen. La abrumadora mayoría del material de entrenamiento es angloparlante y de contexto estadounidense.

Para una agencia argentina esto tiene consecuencias cotidianas y verificables. Los «insights de consumidor» que el sistema genera por omisión corresponden a un consumidor estadounidense de clase media. Las referencias culturales que aporta son ajenas. El español que escribe tiende a un neutro indefinido si no se especifica otra cosa. La contramedida es trivial y su ausencia explica buena parte del material que se descarta: especificar siempre mercado, registro y contexto local no es un detalle de estilo, es la diferencia entre material utilizable y material que hay que rehacer.

Sección 6La evidencia económica

Esta sección presenta lo que se sabe con rigor sobre los efectos de estos sistemas en la productividad y el empleo. Es también la sección que habilita la conversación con un directivo, porque es la única que habla en su idioma.

6.1Tres experimentos

La literatura empírica seria es más pequeña de lo que sugiere el volumen de la discusión, pero es sólida. Tres trabajos revisados por pares concentran la mayor parte del valor probatorio.

El primero es un estudio de campo sobre 5.179 agentes de atención al cliente reales, con despliegue escalonado de un asistente conversacional; no es un laboratorio, es producción.19 La productividad promedio aumentó 14 %, con 34 % entre los trabajadores novatos y de menor calificación e impacto mínimo entre los experimentados. Mejoró además la satisfacción del cliente y aumentó la retención de empleados. El mecanismo que los autores proponen es el más interesante del trabajo: el sistema difunde las prácticas de los mejores trabajadores, porque fue entrenado con las conversaciones de quienes resolvían bien, y ayuda a los nuevos a recorrer la curva de experiencia más rápido. Hay evidencia sugestiva de aprendizaje genuino, no de mera copia.

El segundo es un experimento preregistrado con 453 profesionales universitarios —gerentes, personal de recursos humanos, redactores de subsidios, especialistas en marketing, consultores y analistas— sobre tareas de escritura profesional realistas.20 El tiempo se redujo 40 % y la calidad aumentó 18 %. La desigualdad entre trabajadores disminuyó: el efecto comprimió la distribución beneficiando más a los de menor habilidad inicial. Pero el hallazgo con mayor densidad estratégica es otro, y merece cita literal por lo que implica para una organización creativa: la herramienta sustituyó esfuerzo antes que complementar habilidad, y reestructuró la tarea desplazándola desde la redacción del borrador hacia la generación de ideas y la edición.

El tercero es el estudio de la frontera irregular ya tratado en §5.3.16

6.2La regularidad del nivelador

Los tres experimentos, con poblaciones, tareas y metodologías distintas, convergen en el mismo patrón. Es la regularidad más robusta del campo.

EstudioPoblaciónEfecto en menos experimentadosEfecto en más experimentados
Atención al cliente195.179 agentes+34 %≈ 0 %
Escritura profesional20453 profesionalesMayor beneficioMenor beneficio
Consultoría16758 consultores+43 %Positivo, menor
Cuadro 8. El efecto nivelador. Estos sistemas elevan considerablemente el piso y modestamente el techo. Revisado por pares

Tres implicancias se derivan para una organización de servicios profesionales. La primera es dónde está el retorno: no en potenciar al director creativo sino en que los colaboradores junior rindan como semi-senior, lo cual es una decisión de estructura de equipo antes que una compra de licencias. La segunda es qué se vuelve escaso: si la ejecución se abarata, encarece el criterio —saber qué pedir, saber si lo que volvió sirve, saber qué proponer—. La tercera es la más incómoda y se desarrolla en §7.5: el mismo nivelador opera sobre los competidores.

6.3La brecha entre el experimento y la empresa

Contra esos resultados se levanta una evidencia aparentemente contradictoria. Una encuesta a 1.993 líderes en 105 países encontró que sólo el 39 % de las organizaciones reporta algún impacto en su resultado operativo atribuible a IA, y apenas un 6 % califica como alto desempeño con 5 % o más del resultado atribuible.21 Un reporte muy difundido del MIT llegó a cifrar en 95 % la proporción de pilotos sin retorno medible.23

Advertencia metodológica

El dato del 95 % circuló mucho más de lo que su metodología soporta: se apoya en la revisión de algo más de trescientas iniciativas públicas, cincuenta y dos entrevistas y ciento cincuenta y tres respuestas de encuesta recogidas en conferencias. No es un experimento controlado y la muestra es pequeña y autoseleccionada. Vale como indicio convergente, no como medición. Señalar esto en una exposición no debilita el argumento: demuestra que quien lo presenta evalúa fuentes en lugar de repetirlas.

La contradicción es aparente. Los experimentos y las encuestas miden cosas distintas. En un experimento, alguien definió la tarea, capacitó a los participantes, controló las variables y midió el resultado. En una organización real, casi nunca ocurre nada de eso: se compran licencias, se comunica su disponibilidad, y meses después nadie sabe si sirvieron porque nadie estableció una línea de base. La ganancia de productividad es real; su captura es un problema de gestión, no de tecnología.

Es coherente con esta lectura que casi dos tercios de los encuestados identifiquen la seguridad y el riesgo —y no la regulación ni las limitaciones técnicas— como la principal barrera para escalar.21 Lo que falta no son capacidades: es la confianza organizacional para hacerse cargo de los resultados.

La consecuencia práctica es un método, y es sencillo. Antes de comprar: seleccionar tres tareas frecuentes y medibles, registrar cuánto tiempo insumen hoy y qué significa que salgan bien. Durante cuatro a seis semanas: un grupo trabaja como siempre y otro con la herramienta y formación. Después: extrapolar únicamente sobre lo medido y escalar sólo donde el número dio. Es exactamente lo que el 95 % no hace.

6.4Los canarios: el efecto sobre el empleo inicial

El trabajo más citado sobre efectos laborales analiza datos administrativos de alta frecuencia y encuentra que, desde la adopción masiva de IA generativa, los trabajadores de 22 a 25 años en las ocupaciones más expuestas registran una caída relativa del empleo de entre 13 % y 16 %, incluso controlando por choques a nivel de firma.24 La actualización de febrero de 2026 confirma que, con el conjunto más amplio de controles, las caídas se vuelven estadísticamente significativas a partir de 2024.

El matiz decisivo del trabajo se pierde con frecuencia en su difusión, y es el que un directivo necesita: la caída se concentra en ocupaciones donde la tecnología automatiza trabajo humano —desarrollo de software, atención al cliente—, mientras que en las ocupaciones donde aumenta el trabajo humano el empleo se mantuvo estable o creció.

Nota sobre el uso de este dato

Es un dato potente y delicado frente a alguien con personal a cargo. Corresponde a otro sector y a otro país, y describe una tendencia agregada, no una prescripción. Si surge en la conversación, la lectura defendible es la de §6.2: la evidencia experimental disponible indica que el mayor retorno documentado proviene de potenciar a los colaboradores con menos experiencia, no de reemplazarlos. Esa lectura tiene mejor respaldo empírico y además es la que conviene a una organización que necesita formar seniors dentro de cinco años.

6.5Automatizar o aumentar: qué hace la gente realmente

Existe una fuente de datos sobre uso efectivo, no declarado, construida a partir de conversaciones reales clasificadas por patrón de interacción. Sus resultados corrigen varias intuiciones.25

El primero es que la aumentación —interacción colaborativa donde la persona itera, aprende o recibe devolución— superó a la automatización, con 52 % frente a 45 % de las conversaciones. El uso predominante no es delegar y retirarse: es trabajar junto al sistema. Es exactamente el patrón «cíborg» de §5.3, y es el que se corresponde con los resultados de productividad más altos.

El segundo es la concentración. Sobre unas tres mil tareas laborales distintas, las diez principales concentraban en su momento el 24 % del total, proporción que había venido creciendo. Los datos de febrero de 2026 muestran una diversificación: las diez principales bajaron al 19 %, cerca de la mitad de las ocupaciones registra al menos un cuarto de sus tareas ejecutadas con asistencia, y la adopción se extendió hacia tareas de menor remuneración. La tecnología está saliendo del nicho técnico.

Para la región, los datos disponibles son alentadores y conviene tenerlos a mano: América Latina exhibe un 47 % de empresas usando IA, por encima del promedio global de 45 %, con Argentina a la cabeza regional con 68 % de adopción empresarial y tercera a nivel global en uso individual regular con 29 % de la población en edad de trabajar.26 Una encuesta con respaldo del BID y la Fundación Observatorio PyME sobre 402 empresas industriales y de software ofreció el primer panorama estadísticamente representativo de la incorporación en pymes argentinas. Industria

El uso de este dato en una sala argentina debe ser cuidadoso pero es eficaz: no instala pánico, instala contexto competitivo. La pregunta deja de ser si incorporar la tecnología y pasa a ser si se la incorpora de manera ordenada o desordenada.

Sección 7El caso particular de la industria creativa

Todo lo anterior aplica a cualquier organización de trabajo de conocimiento. Esta sección trata lo que es específico de una agencia, y sostiene que allí converge una amenaza que no aparece en los demás sectores: la misma tecnología que eleva la calidad promedio erosiona aquello que la agencia vende.

7.1La homogeneización del producto

El trabajo decisivo es un experimento publicado en Science Advances en el que algunos escritores recibían ideas generadas por un modelo antes de escribir relatos breves.27 Los resultados forman un par que conviene no separar.

Por un lado, el acceso a ideas generadas hizo que los relatos fueran evaluados como más creativos, mejor escritos y más disfrutables, con un efecto más pronunciado entre los escritores menos creativos —el mismo patrón nivelador de §6.2, ahora en el dominio estético—. Por otro lado, los relatos producidos con asistencia se parecían más entre sí que los producidos sin ella. La formulación de los autores es exacta: un aumento de la creatividad individual a riesgo de perder la novedad colectiva.

El hallazgo no está aislado. El estudio de consultoría de §5.3 registra el fenómeno desde otro ángulo: los consultores de élite que trabajaron con GPT-4 produjeron ideas con marcadamente menos variabilidad que quienes trabajaron sin asistencia.16 Dos poblaciones distintas, dos dominios distintos, el mismo resultado.

La consecuencia para una agencia es de naturaleza estratégica y no operativa. El producto que una agencia vende es la diferenciación. Si el conjunto de la industria opera con las mismas cuatro herramientas y formulaciones semejantes, el piso de calidad sube para todos y la distancia entre competidores se comprime. La tecnología no amenaza la calidad del trabajo: amenaza su distintividad, que es un problema distinto y peor.

7.2El colapso del costo de producción audiovisual

Mientras tanto, la economía de la producción cambió de escala. Los sistemas de generación de video alcanzaron en 2026 costos de fracción de dólar por segundo: un clip de cinco segundos con calidad de marketing se sitúa en el orden de los cincuenta centavos a dos dólares, y las tarifas por segundo se ubican entre cinco centavos y setenta y cinco centavos según nivel de calidad.28 Contra un comercial de sesenta segundos producido de manera tradicional, cuyo rango habitual va de quince mil a cincuenta mil dólares, la diferencia de costos es de dos órdenes de magnitud.

La adopción acompaña: cerca del 90 % de los anunciantes usaría IA generativa para construir avisos en video hacia 2026, según relevamientos de la industria, y los equipos profesionales convergieron en flujos multimodelo que asignan a cada sistema el tramo donde rinde mejor. Industria

Dos advertencias corresponden. La primera es que estas cifras comparan costo de generación contra costo de producción completa, omitiendo dirección, selección, iteración, derechos y aprobación —es la misma distorsión señalada en §3.2—. La segunda es §7.3.

7.3La paradoja de la divulgación

Aquí aparece el hallazgo más contraintuitivo de esta sección y el que más directamente afecta la relación con un cliente.

La investigación disponible identifica lo que se ha dado en llamar el dilema de la divulgación: los avisos etiquetados como generados o asistidos por IA obtienen puntuaciones de favorabilidad medibemente más bajas que equivalentes sin etiquetar, aun cuando la calidad creativa se evalúa idéntica en pruebas ciegas.29 La divulgación activa el conocimiento de persuasión del consumidor y erosiona indicadores de confianza en contextos diversos, si bien los efectos no son universales ni uniformes. Relevamientos de la industria encuentran además que los consumidores de las cohortes más jóvenes tienen una opinión bastante menos favorable sobre la publicidad generada con IA que la que los ejecutivos publicitarios les atribuyen.

La paradoja es evidente: la §8.1 documenta que divulgar dejó de ser opcional en varias jurisdicciones, mientras la evidencia de consumo indica que divulgar cuesta favorabilidad. La salida que la investigación sugiere no es ocultar sino recomponer: la lectura predominante es que los consumidores no están en contra de la IA, están en contra del engaño, y que las marcas que sostienen resultados son las que divulgan, curan y humanizan su uso en lugar de disimularlo.

Para una agencia esto se traduce en una recomendación concreta: la política de divulgación no debe improvisarse cuando un cliente pregunte, y no debe delegarse en el área legal como mero cumplimiento. Es una decisión de posicionamiento de marca, y conviene tomarla antes de necesitarla.

7.4La reestructuración del sector

El contexto competitivo en el que se toma esta decisión cambió de manera profunda durante 2025 y 2026, y conviene que un directivo de agencia lo tenga presente, porque desplaza la conversación desde la herramienta hacia el modelo de negocio.

La fusión Omnicom-IPG, completada a fines de 2025, creó el mayor holding del mundo. WPP anunció el desmantelamiento de su estructura de holding con un objetivo de quinientos millones de libras de ahorro y una reorganización integrada en torno a IA, y declaró el fin de lo que su nueva conducción describió como el mito centenario de una «familia» de marcas de agencia significativamente distintas. Publicis mantiene el énfasis en IA, medios conectados y comercio como motores de crecimiento por encima de los servicios publicitarios tradicionales. Industria / prensa sectorial30

El dato que ordena la interpretación es la divergencia: mientras la inversión publicitaria mundial creció 8,6 % interanual en 2025, los ingresos de los holdings cayeron 1,2 %. La presión no proviene de una contracción del mercado sino de una redistribución del valor dentro de la cadena. El diagnóstico sectorial es explícito: la IA generativa ejecuta hoy tareas que antes requerían equipos de redactores, diseñadores y compradores de medios, lo que comprime el margen de cada capa del modelo tradicional.

La consecuencia analítica es que la discusión sobre IA en una agencia no es una discusión de herramientas de productividad. Es una discusión sobre qué parte de la cadena de valor sigue siendo defendible.

7.5Qué se vuelve escaso

Reunidos, los cinco elementos anteriores permiten formular la tesis central de esta sección, que es también la que conviene reservar para el cierre de la primera clase.

El costo del insumo cae un orden de magnitud por año (§3.3). El efecto sobre la calidad es nivelador: sube el piso, no el techo (§6.2). El producto tiende a homogeneizarse (§7.1). La producción audiovisual pierde dos órdenes de magnitud de costo (§7.2). El sector se reestructura porque el valor se desplazó (§7.4).

De todo lo cual se sigue que usar la herramienta no será una ventaja, porque todos la usarán. La ventaja tendrá que provenir de lo que se le agregue: el conocimiento específico del cliente y de su mercado, el criterio para descartar lo que la máquina produce con fluidez, y la disposición a proponer algo que no sea el promedio de internet —que es, literalmente, lo que un modelo de lenguaje devuelve cuando no se lo restringe—.

Formulada así, la conversación deja de ser sobre software y pasa a ser sobre posicionamiento. Es la conversación que corresponde tener con quien dirige una agencia, y es la razón por la cual una formación en esta materia no debería terminar en el manejo de la herramienta.

Sección 8Gobernanza: obligaciones, riesgos y la disciplina que falta

El marco normativo se cerró considerablemente en el último año. Esta sección no constituye asesoramiento legal —el autor no es abogado y así lo declara ante cualquier audiencia— sino un mapa de qué existe, qué está en disputa y qué puede hacerse internamente sin esperar a que se resuelva.

8.1El AI Act europeo y su alcance real

El 2 de agosto de 2026 —cinco días antes de la redacción de este documento— entraron en vigor las obligaciones de transparencia del artículo 50 del Reglamento de Inteligencia Artificial de la Unión Europea.31 Obligan en cuatro frentes: informar cuando una persona interactúa directamente con un sistema de IA, salvo que resulte evidente; marcar el contenido generado artificialmente en formato legible por máquina; informar en casos de reconocimiento de emociones y categorización biométrica; y declarar las ultrafalsificaciones y el texto generado por IA sobre asuntos de interés público. Las sanciones alcanzan los quince millones de euros o el 3 % de la facturación mundial anual, la cifra que resulte mayor.

FechaObligación
2 ago 2026Transparencia (art. 50) exigible. Vigente.
2 dic 2026Fin del período transitorio para marcado y detección en sistemas generativos ya presentes en el mercado
2 dic 2027Sistemas de alto riesgo del Anexo III, pospuestos desde agosto de 2026
Cuadro 9. Calendario de aplicación.31 Normativa

Que la norma sea europea no la vuelve irrelevante para una agencia argentina, por tres razones de peso decreciente. La primera es de alcance: si el cliente opera en la Unión Europea o la campaña se difunde allí, la obligación viaja con el contenido. La segunda es histórica: el estándar europeo tiende a convertirse en el estándar global por defecto, como ocurrió con el régimen de protección de datos. La tercera es contractual y es la más inmediata: los contratos con clientes grandes ya incorporan cláusulas de declaración de uso de IA, de modo que la incapacidad de responder qué se utilizó en cada pieza es un problema comercial antes que regulatorio.

8.2Propiedad intelectual: dos puntos que sí importan

El litigio es voluminoso —más de setenta acciones activas por infracción contra empresas de IA, con decisiones relevantes sobre uso legítimo esperadas a lo largo de 2026— e incluye demandas de medios contra desarrolladores de modelos, de estudios cinematográficos contra generadores de imagen, y decisiones ya dictadas en Europa, entre ellas un fallo del tribunal regional de Múnich que consideró reproducción ilícita la memorización de letras de canciones.32 El criterio que parece consolidarse es de competencia de mercado: cuando la salida del sistema compite con el mercado de los datos con los que se entrenó, los tribunales tienden a encontrar infracción.

De todo ese panorama, dos puntos son los que una agencia necesita conocer.

El primero: las obras puramente generadas por IA no resultan registrables como propiedad intelectual, y el prompt por sí solo no constituye autoría. Para una organización cuyo producto son activos de marca, esto no es un tecnicismo: significa que una pieza enteramente generada puede dejar al cliente sin nada que proteger frente a una copia.

El segundo: la responsabilidad aguas abajo no está resuelta. Si la herramienta se entrenó con material protegido y la campaña sale al aire, quién responde permanece indeterminado en la mayoría de las jurisdicciones. El riesgo no reside únicamente en el proveedor.

8.3La disciplina que falta: evaluación

Hay una conclusión que atraviesa este documento y que conviene enunciar por separado, porque es la que menos se enseña y la que más determina resultados. Si la ganancia es real pero no se captura (§6.3), si la frontera de capacidad es irregular e invisible (§5.3), y si la artesanía del prompt será automatizada (§4.6), entonces la competencia organizacional decisiva no es formular pedidos: es evaluar salidas de manera sistemática.

La práctica industrial se movió en esa dirección con rapidez. El uso de un modelo como evaluador automático —juzgando salidas contra criterios definidos en lenguaje natural— se volvió el método por defecto para evaluar a escala, con concordancia con revisores humanos en torno al 85 %, superior a la concordancia entre dos humanos, y con un costo por evaluación de fracciones de centavo frente a los cinco a cincuenta dólares por instancia de la revisión humana.33 La formulación que circula en la industria es que los equipos que tratan las evaluaciones como pruebas —que se escriben temprano y se ejecutan de manera continua— iteran más rápido y detectan regresiones antes de que se acumulen. Industria

Para una agencia esto no implica construir infraestructura. Implica algo más modesto y más urgente: definir por escrito, para cada tipo de entregable, qué significa que esté bien. Sin ese criterio explícito no hay manera de saber si la herramienta ayudó, no hay manera de detectar cuándo empeoró, y no hay manera de delegar sin riesgo. Es también, no casualmente, el mismo requisito que §6.3 identifica como ausente en el 95 % de los pilotos fallidos.

8.4La política interna como entregable

Lo anterior converge en un documento breve —dos páginas bastan— que toda organización debería tener antes de comprar licencias, y que constituye la recomendación más accionable de este trabajo. Sus secciones son seis.

Qué información no se ingresa nunca: datos personales de consumidores, información financiera de clientes, resultados no publicados, encargos bajo acuerdo de confidencialidad. La regla mnemotécnica que funciona con audiencias no técnicas: si no lo enviaría por correo sin cifrar, no lo pegue.

Qué herramientas están autorizadas y bajo qué plan, con una precisión que suele omitirse: cuentas de la organización, no personales. Cuando el personal usa cuentas gratuitas propias, la organización perdió el control sin enterarse.

Qué se declara al cliente y en qué casos, decidido antes de que alguien pregunte y a la luz de §7.3.

Qué se verifica siempre: toda cifra, nombre propio, fecha, cita y referencia normativa (§5.1).

Quién aprueba: ninguna pieza sale sin revisión humana identificable con nombre y apellido. Un proceso anónimo no es un control.

Cómo se registra: un campo en el sistema de proyectos indicando qué herramienta se usó, para qué parte y quién revisó. Treinta segundos por pieza, y es lo único que permite responder cuando pregunte un cliente o un regulador.

Sección 9Implicaciones pedagógicas: cómo se enseña esto

Este documento se escribió para poder enseñar su contenido. Esta sección traduce lo anterior en decisiones de diseño de una formación, y explicita los criterios que gobiernan el guion del apéndice A.

9.1Un marco para ordenar la competencia

El marco pedagógico más útil disponible fue desarrollado por dos profesores universitarios en colaboración con un laboratorio, y define la fluidez en IA como la capacidad de trabajar con estos sistemas de manera efectiva, eficiente, ética y segura.34 Descompone esa capacidad en cuatro competencias.

CompetenciaDefiniciónPregunta que responde
DelegaciónFijar objetivos y decidir si, cuándo y cómo involucrar al sistema¿Esto se lo doy o no?
DescripciónDescribir el objetivo de modo que produzca el comportamiento buscado¿Cómo se lo pido?
DiscernimientoEvaluar con criterio la utilidad de lo producido¿Esto está bien?
DiligenciaResponsabilizarse por lo que se hace y por cómo se hace¿Me hago cargo?
Cuadro 10. Las cuatro competencias del marco de fluidez.34 El curso está disponible de forma gratuita y con certificación.

El marco resuelve un problema de encuadre que de otro modo compromete toda la formación. El encargo pedía «herramientas de prompt», que corresponde exclusivamente a la segunda competencia. Presentar las cuatro permite mostrar, sin contradecir el pedido, que la formulación del prompt es apenas una cuarta parte del asunto, y que las otras tres son decisiones de gestión antes que de redacción. Para quien dirige una organización, esa es precisamente la conversación pertinente.

9.2Siete criterios de diseño

Primero: enseñar el mecanismo antes que la receta. Por lo argumentado en §1. Una técnica explicada desde el mecanismo sobrevive a la próxima versión; una lista de fórmulas, no.

Segundo: no enseñar nada que no se haya ejecutado personalmente. Quien dirige una organización distingue en menos de un minuto entre alguien que sabe y alguien que recita. Cada técnica debe haberse probado con un caso real de la organización destinataria antes de la clase, y las capturas deben conservarse como respaldo ante fallas de conectividad.

Tercero: señalar el estatus de cada fuente. Por lo argumentado en §1. Presentar el 95 % de pilotos fallidos junto con su advertencia metodológica (§6.3) no debilita el argumento: establece que quien expone evalúa evidencia.

Cuarto: declarar explícitamente lo que no se sabe. Hay cuatro puntos donde corresponde: no se comprende del todo por qué funcionan; no se puede anticipar qué sabrá hacer el próximo modelo (§2.3); la transparencia sobre datos de entrenamiento está empeorando —el índice de transparencia de modelos fundacionales cayó de 58 a 40 puntos—22; y las alucinaciones no admiten solución completa (§5.1). Marcar los límites del propio conocimiento es lo que vuelve creíble el resto.

Quinto: demostrar, no describir. Las cinco demostraciones del apéndice A están elegidas por una propiedad: producen un resultado contraintuitivo en menos de un minuto. El cambio de orden de los ejemplos (§4.2) y el contraste entre pedir aprobación y pedir crítica (§5.2) son las de mayor rendimiento y conviene reservarlas para cuando decaiga la atención.

Sexto: llegar temprano a algo aplicable. La primera técnica utilizable debe entregarse antes del minuto treinta. En el guion propuesto es la de §2.5 —pedir problemas en lugar de aprobación—, que se deduce de la explicación del entrenamiento y por lo tanto no interrumpe la exposición conceptual.

Séptimo: cerrar en estrategia, no en herramienta. Por §7.5. Una formación que termina explicando funcionalidades produce un usuario; una que termina en la conversación sobre diferenciación produce un interlocutor.

9.3Qué queda fuera de una primera clase

El encargo pedía una introducción. En consecuencia, quedan deliberadamente fuera de la primera sesión: la arquitectura de §2.2, la totalidad de §3 salvo dos datos, la recuperación aumentada y la ingeniería de contexto, los agentes, el detalle de la evidencia económica y el desarrollo normativo. Todo ello debe conocerse para responder si surge —esa es la función de este documento— pero no se dicta.

La tentación de exceder el encargo es fuerte y debe resistirse. Una primera clase que abarca todo produce la sensación de haber asistido a una exposición; una que cubre tres cosas y las deja utilizables produce la decisión de contratar la segunda.

Sección 10Conclusión

La evidencia revisada permite sostener cuatro proposiciones simultáneamente, y la dificultad de la discusión pública sobre esta tecnología reside justamente en que rara vez se las sostiene juntas.

Los efectos son grandes y están bien medidos. Reducciones de 40 % en tiempo y aumentos de 18 % en calidad para escritura profesional; 40 % de mejora de calidad en consultoría; 14 % de productividad en atención al cliente medida en producción real. Son experimentos controlados, preregistrados y revisados por pares (§6.1).

Los efectos son extremadamente desiguales. Se concentran en los trabajadores menos experimentados (§6.2) y desaparecen —o se invierten— del otro lado de una frontera de capacidad que es irregular y no observable desde afuera (§5.3). La misma herramienta, con la misma gente y el mismo día, mejora un 40 % la calidad en una tarea y aumenta diecinueve puntos la probabilidad de error en la siguiente.

Casi ninguna organización los está capturando. Un 39 % reporta algún impacto operativo; un 6 % reporta impacto sustantivo (§6.3). La discrepancia con los experimentos no es una contradicción: es la medida exacta de lo que la gestión no está haciendo —definir la tarea, formar a la gente, establecer una línea de base y medir—.

Y para una organización creativa hay una amenaza adicional que no aparece en los demás sectores. La tecnología eleva el piso y comprime la diversidad del producto (§7.1), mientras el costo del insumo cae un orden de magnitud por año (§3.3) y el sector redistribuye valor fuera del modelo tradicional (§7.4). Lo que se vuelve escaso no es la capacidad de producir: es la capacidad de producir algo distinto.

De todo lo cual se desprende la recomendación con la que corresponde cerrar, y que es más modesta de lo que el volumen de la discusión pública haría esperar. No consiste en adquirir tecnología, sino en construir tres cosas que ninguna licencia provee: criterio para decidir qué delegar, método para verificar lo que vuelve, y una definición escrita de qué significa que un trabajo esté bien. La primera se enseña; la segunda se practica; la tercera es una decisión de dirección.

La formación que este documento prepara empieza, por lo tanto, con la técnica que el encargo pidió, y termina donde corresponde: en la conversación sobre qué va a distinguir a esta organización cuando todos sus competidores tengan exactamente las mismas herramientas.

Apéndice AGuion de la primera clase

Noventa minutos. Al final se indica cómo comprimir a sesenta y cómo extender a ciento veinte. La distribución del tiempo respeta el encargo: introducción 25 minutos, prompting 40, herramientas 15, límites y cierre 10.

Verificación previa

  • Las tres herramientas abiertas, con sesión iniciada y probadas el mismo día.
  • Un encargo real de la organización, listo para cargar, preferentemente de una cuenta que el destinatario conozca.
  • Las cinco demostraciones ejecutadas previamente, con capturas guardadas como respaldo ante falla de conectividad. Ensayar con la conexión apagada.
  • La plantilla del apéndice B impresa, dos copias.
  • Versiones vigentes de cada herramienta verificadas esta semana. No citar versiones no comprobadas.
  • Averiguado informalmente qué usa hoy el personal. Si el destinatario pregunta «¿y acá qué usan?» y no hay respuesta, se pierde la autoridad de todo lo demás.
0:00–0:05
Apertura

Abrir con dos preguntas, no con una definición: ¿ya usa alguna de estas herramientas? ¿qué le gustaría poder hacer el viernes que hoy no puede? La segunda respuesta se anota: es el cierre de la clase.

Encuadre en sesenta segundos: no habrá trucos sino explicación del funcionamiento; todo lo que se afirme tiene fuente; y no es una charla sino una práctica.

0:05–0:20
Qué es esto

Los dos malentendidos: no encuentra, genera; no consulta, predice. La formulación correcta —motor de texto plausible— y el subrayado de «plausible» (§2.1).

La analogía del colaborador junior, dicha despacio: leyó todo, escribe rapidísimo, y tiene tres particularidades —no conserva memoria entre reuniones, es incapaz de decir «no sé», y no sabe nada de los clientes de la casa—. Es el momento en que se instala el modelo mental correcto, y funciona porque un directivo ya sabe cómo se dirige a un junior brillante.

Cierre del bloque con el dato de §2.4: un modelo cien veces menor resultó preferible por estar mejor alineado. El grande sabía más; el chico comprendía mejor. Es la mejor transición disponible hacia el bloque de prompting.

0:20–0:30
Cómo aprendió, y qué le quedó de eso

Las tres etapas (§2.4), con el ejemplo del modelo crudo que responde a una pregunta con otra pregunta y tiene razón estadísticamente.

El costo de la tercera etapa (§2.5): cortesía, verborragia, confianza no calibrada y concesión ante la insistencia. Primera técnica aplicable de la clase, entregada antes del minuto treinta: cuando le da la razón, eso no es evidencia de que usted la tenga. Para una opinión honesta, pedir los tres problemas más serios en lugar de preguntar si está bien.

0:30–0:38
Prompting · Encuadre y demostración 1

«Un prompt no es una búsqueda: es un encargo.» El destinatario redacta encargos a diario; no se le enseña algo nuevo, se le pide que aplique algo que domina a un interlocutor que no se ofende si se es obvio y no pregunta si no se lo autoriza.

Demostración 1 — el antes y el después. Pedido vago frente a pedido con los seis bloques, en pantalla, uno junto al otro. Antes de mostrar el segundo, preguntarle qué le falta al primero. Cuando lo enuncia él, ya no hay que enseñárselo.

0:38–0:45
La plantilla · Demostración 2

Entregar la plantilla impresa, en papel, en la mano (apéndice B).

Demostración 2 — mostrar en lugar de describir. Encabezados sin ejemplos frente a encabezados con cinco piezas aprobadas de una marca real de la casa. Es la técnica de mayor retorno económico y merece tiempo. Recomendación asociada: un archivo por cuenta con diez piezas aprobadas, media hora de trabajo por cuenta, una sola vez.

El truco del orden (§4.2): los mismos tres ejemplos en dos secuencias distintas producen respuestas distintas. Contraintuitivo, verificable en cuarenta segundos.

0:45–0:52
Demostración 3 — la autorización de la incertidumbre

Momento de mayor densidad conceptual de la clase. No apurarlo.

Primero una consulta dudosa sin la cláusula: fabrica el dato con total seguridad. Después la misma consulta con «si no tenés información suficiente, decilo en lugar de especular»: admite.

Y entonces el fundamento (§5.1): el propio fabricante publicó por qué ocurre. Los modelos se evalúan como en un examen mal diseñado, donde errar y abstenerse valen lo mismo, de modo que arriesgar siempre conviene. Al escribir esa cláusula, usted está corrigiendo a mano ese incentivo. Aquí el paper y la técnica cierran en un círculo, y es donde la exposición deja de parecer una lista de consejos.

0:52–1:00
Demostraciones 4 y 5 · Errores

Demostración 4 — la crítica. «¿Está bien esto?» frente a «enumerá los tres problemas más serios». Misma pieza, mismo modelo, treinta segundos de diferencia (§5.2).

Demostración 5 — lo que caducó. «Actuá como un director creativo con veinte años de experiencia» frente a «analizá esto priorizando diferenciación de categoría y riesgo de marca». Explicitar que el consejo emblemático de 2023 hoy la propia documentación del fabricante lo señala como frecuentemente innecesario (§4.4). Sirve para instalar que se enseña el estado actual y no un manual viejo.

Los cinco errores frecuentes (§4.4), con énfasis en el último: quien evalúa la herramienta en un solo intento la evalúa mal. Es una conversación, no un botón.

1:00–1:10
Dónde falla

La frontera irregular, contada despacio (§5.3): 758 consultores, 40 % más de calidad y 25 % más rápido dentro de la frontera; diecinueve puntos porcentuales más de error del otro lado. Misma gente, misma herramienta, mismo día. Y el borde no se ve desde afuera: la respuesta equivocada llega tan bien escrita como la correcta. De ahí que esto se aprenda operando con criterio y no leyendo un instructivo —que es, dicho sin decirlo, la justificación de la formación—.

Los otros cuatro límites, rápido: fabricación de datos, degradación en textos largos, ausencia de memoria entre conversaciones, sesgo cultural. Y la regla que se lleva escrita: toda cifra, nombre propio, fecha o cita que vaya a un documento de cliente se verifica.

1:10–1:25
Las herramientas

No un ranking sino un criterio de elección por tipo de tarea: escritura larga con formato estricto, funciones amplias y multimodalidad, integración con la suite ofimática existente, investigación con fuentes. El consenso corporativo es híbrido.

Demostración 6 — sobre los documentos de la casa. Cargar un encargo real y hacerle preguntas concretas sobre esa cuenta. Es la demostración que más importa: mientras la exposición trata de «la IA en general» es una curiosidad; cuando aparece el material propio, cambia la conversación. Cerrar ofreciendo armar en la sesión siguiente el espacio de trabajo de una cuenta real.

Privacidad, anticipándose a la pregunta: regla operativa —si no lo enviaría por correo sin cifrar, no lo pegue—; y la observación incómoda de que hoy nadie sabe si alguien cargó material bajo confidencialidad en una cuenta gratuita, lo cual no se resuelve con una herramienta sino con dos páginas de política (§8.4).

1:25–1:35
Cierre estratégico

El marco de las cuatro competencias (§9.1), con el señalamiento de que el prompt es una de cuatro y las otras tres son decisiones de dirección.

Y el cierre de §7.5, que es la parte más importante de la clase: dos estudios independientes muestran que estos sistemas suben el piso y comprimen la diversidad —a esta casa y a sus competidores al mismo tiempo—. Usar la herramienta no será una ventaja porque todos la usarán. La ventaja estará en lo que se le agregue: conocimiento del cliente, criterio para descartar, y disposición a proponer algo que no sea el promedio de internet. No es una conversación de herramientas: es una conversación estratégica.

1:35–1:40
Legal, una sola diapositiva

Dos datos y seguir: las obligaciones de transparencia europeas rigen desde el 2 de agosto (§8.1), y una pieza puramente generada puede no ser registrable (§8.2).

Y entonces la declaración textual, sin improvisar: «Acá me detengo. No soy abogado y esto no es asesoramiento legal. Mi trabajo es que sepa que esto existe y que está cambiando rápido. Si le parece, le dejo por escrito qué preguntas hacerle a su asesor.» Protege, aumenta la credibilidad del resto, y deja un entregable pendiente.

1:40–1:45
Cierre y tarea

Retomar la respuesta que dio en el minuto dos y mostrar que ya puede empezar. Tres encargos para la semana: usar la plantilla tres veces con material real; armar el archivo de tono de una cuenta; hacer el curso de las cuatro competencias. Y la propuesta de la sesión siguiente.

Si sólo hay sesenta minutos

Suprimir el bloque de las tres etapas conservando únicamente la observación sobre adulación; contar las demostraciones 4 y 5 en treinta segundos cada una sin ejecutarlas; reducir los límites secundarios a la regla de verificación. No tocar las demostraciones 1, 2, 3 y 6 ni el cierre estratégico.

Si hay ciento veinte minutos

Agregar veinte minutos de práctica guiada —que redacte él un encargo con la plantilla, sobre algo real suyo, y se corrija en conjunto— y diez de descomposición en pasos encadenados. La práctica guiada es, con diferencia, el mejor uso del tiempo adicional: escuchar es una cosa, escribir y ser corregido es donde efectivamente se aprende.

Las cinco frases que deben sobrevivir al martes

  1. Un prompt no es una búsqueda: es un encargo.
  2. Es incapaz de decir «no sé», salvo que se lo autorice.
  3. La frontera es irregular, y desde afuera no se ve dónde está el borde.
  4. Mostrale ejemplos en lugar de describirle el tono.
  5. Esto le sube el piso a todos, incluidos sus competidores. La diferencia se jugará en otro lado.

Apéndice BPlantilla de encargo y ejemplo desarrollado

La plantilla se entrega impresa. Su argumento de venta es que no introduce nada nuevo: es un encargo profesional, dirigido a un destinatario que no se ofende si se es obvio y no pregunta si no se lo autoriza.

Seis bloques

  1. ContextoQuién soy, para quién trabajo, qué está ocurriendo.
  2. ObjetivoQué necesito y para qué lo necesito. El motivo importa tanto como la instrucción (§4.3).
  3. AudienciaQuién va a leerlo y en qué situación lo lee.
  4. RestriccionesQué no puede hacer: territorios agotados, limitaciones legales, registros prohibidos.
  5. FormatoEstructura exacta de salida. Mejor aún: un ejemplo en lugar de una descripción.
  6. Criterio de éxitoCómo sé que está bien. Y siempre: «si te falta información, pedímela en lugar de suponer».

El contraste, para la demostración 1

Pedido vago — produce el promedio
ideas para campaña de yogur
El mismo pedido con los seis bloques
CONTEXTO
Somos la agencia de [MARCA], un yogur premium con probióticos.
Compite con las dos marcas líderes de góndola. Su precio está un 40%
por encima del promedio de la categoría. El problema de negocio es
concreto: la gente lo prueba y lo abandona a los dos meses.

OBJETIVO
Ocho territorios creativos para una campaña de RETENCIÓN, no de prueba.
El foco es quien ya lo compró y dejó de comprarlo. Lo necesito para
presentar internamente el jueves y elegir tres para desarrollar.

AUDIENCIA
Mujeres de 30 a 45 años, nivel socioeconómico medio-alto, CABA y zona
norte. Ya conocen la marca y les pareció cara para lo que sentían
que les daba.

RESTRICCIONES
Nada de "bienestar" ni "vos te lo merecés": es el territorio de toda
la categoría y está agotado. Nada que prometa beneficios de salud,
porque no lo podemos sostener legalmente. Español rioplatense.

FORMATO
Para cada territorio: nombre de 3 a 5 palabras, insight en una frase,
idea en dos líneas, y por qué le habla puntualmente a alguien que
ya abandonó.

CRITERIO DE ÉXITO
Antes de listar, escribí en dos líneas cuál te parece que es la
tensión real del abandono. Si la información que te di no alcanza
para identificarla, decímelo en lugar de suponer.

La diferencia de resultado no proviene de la extensión sino de la presencia de contexto, motivo, restricciones y criterio de éxito. Obsérvese que la última línea implementa la contramedida de §5.1 y que la restricción de registro implementa la de §5.5.

Fórmulas breves de aplicación inmediata

Contra la adulación (§5.2)
No me digas si está bien. Enumerá los tres problemas más serios
de esto, ordenados por gravedad, y para cada uno explicá qué
tendría que cambiar. Leelo como si fueras quien lo tiene que
aprobar y se juega su nombre.
Tono de marca por ejemplos (§4.3)
Estos son titulares aprobados de la marca. Observá el tono:

1. [ejemplo aprobado]
2. [ejemplo aprobado]
3. [ejemplo aprobado]
4. [ejemplo aprobado]
5. [ejemplo aprobado]

Escribí cinco titulares nuevos con exactamente ese tono, para
[nuevo producto o campaña]. Mantené la longitud y la estructura
sintáctica de los ejemplos.
Descomposición con control intermedio (§4.3)
Paso 1 — Leé este encargo del cliente y extraé cuatro cosas:
         objetivo de negocio, público, restricciones, y qué NO
         está dicho pero se está asumiendo.
         Frená ahí y mostrámelo antes de seguir.

Apéndice CPlan de estudio previo

Nueve horas repartidas en cuatro días. Es lo que hace falta para dictar la primera clase sin recitar.

Jueves
2 h

Lectura corrida de §1 a §3. No estudiar: leer. El objetivo es tener el mapa completo antes de profundizar en nada.

Viernes
3 h

§4 completa, que es la que el encargo pidió. Ejecutar personalmente las seis demostraciones del apéndice A con material real de la casa y guardar las capturas. Sin este paso no hay clase.

Sábado
2 h

§5 y §6. Abrir las cuatro herramientas principales y darle a cada una la misma tarea real durante veinte minutos. Hace falta opinión propia, no la de este documento. Verificar versiones vigentes y leer las condiciones de privacidad de al menos dos, anotando la fecha de consulta.

Domingo
2 h

Apéndice A ensayado en voz alta y cronometrado, al menos una vez con la conexión apagada. Lectura rápida de §7 a §9 para no quedar mudo ante preguntas fuera de programa.

La regla que no se negocia

No enseñar nada que no se haya ejecutado personalmente. Quien dirige una organización distingue en menos de un minuto entre alguien que sabe y alguien que recita. Si una técnica no se probó con las propias manos y con un caso real, no se dicta.

ReferenciasFuentes citadas

Cada entrada indica su estatus epistémico. Revisado por pares publicación con revisión de pares o norma vigente · Preprint literatura técnica sin revisión, de laboratorios o grupos académicos · Industria reportes de consultoras, observatorios o fabricantes · Secundaria agregadores y prensa sectorial, útiles como indicio, no como medición.

  1. PreprintVaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł. y Polosukhin, I. «Attention Is All You Need». 2017. Presentado luego en NeurIPS 2017. Introduce la arquitectura Transformer.arxiv.org/abs/1706.03762
  2. Revisado por paresWei, J. et al. «Emergent Abilities of Large Language Models». Transactions on Machine Learning Research, 2022.arxiv.org/abs/2206.07682
  3. PreprintOuyang, L., Wu, J., Jiang, X. et al. «Training language models to follow instructions with human feedback». OpenAI, 2022. Introduce InstructGPT y el procedimiento de RLHF. Fuente del resultado 1,3 B frente a 175 B.arxiv.org/abs/2203.02155
  4. PreprintWei, J., Wang, X., Schuurmans, D., Bosma, M., Ichter, B., Xia, F., Chi, E., Le, Q. y Zhou, D. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». 2022.arxiv.org/abs/2201.11903
  5. PreprintSchulhoff, S., Ilie, M., Balepur, N. et al. «The Prompt Report: A Systematic Survey of Prompting Techniques». 2024, v6 de febrero de 2025. 33 términos, 58 técnicas para texto, 40 para otras modalidades. Fuente de las seis familias, de los seis factores de los ejemplos y del resultado sobre optimización automática.arxiv.org/abs/2406.06608Síntesis accesible
  6. IndustriaAnthropic. «Prompt engineering best practices» y documentación de plataforma, 2026. Fuente de las nueve prácticas y de la declaración de obsolescencia de las etiquetas XML y la asignación de rol.claude.com/blog/best-practices-for-prompt-engineeringDocumentación técnica
  7. SecundariaAnálisis sobre agotamiento del preentrenamiento y escalado del aprendizaje por refuerzo. 2026. Recoge la posición de Sutskever en NeurIPS 2024 y las estimaciones de mesetas por capacidad. Literatura técnica relacionada: «The Art of Scaling Reinforcement Learning Compute for LLMs» y «A Survey of Frontiers in LLM Reasoning».buildfastwithai.com/blogs/llm-scaling-laws-explainedarXiv 2510.13786arXiv 2504.09037
  8. SecundariaPanorama de modelos de razonamiento y cómputo en inferencia. 2026. Fuente de la cifra de ARC-AGI-2 y de la saturación de MMLU. Conviene verificar contra fuente primaria antes de citarla en público.zylos.ai/research/2026-01-24-ai-reasoning-models
  9. PreprintOpenAI. «GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks». 2025. 1.320 tareas, 44 ocupaciones, nueve sectores. Tareas construidas a partir de profesionales con 14 años de experiencia promedio.arxiv.org/abs/2510.04374Presentación
  10. IndustriaEstimaciones convergentes sobre el costo de inferencia. a16z, «LLMflation», y análisis posteriores hasta 2026. Las cifras exactas dependen de qué se considere capacidad equivalente; el orden de magnitud —cerca de 10× de caída anual— es consistente entre fuentes.a16z.com/llmflation-llm-inference-cost
  11. PreprintMETR. «Measuring AI Ability to Complete Long Tasks». 2025, con actualizaciones. Duplicación del horizonte cada ~7 meses durante seis años, acortada a ~4 meses en 2024-2025. El horizonte al 80 % exhibe la misma pendiente.metr.orgSeguimiento en Epoch AI
  12. SecundariaEstudio sobre primacía del contexto por sobre el fraseo. Reportado como publicación revisada de febrero de 2026, sobre 9.649 experimentos en 11 modelos y cuatro formatos de contexto. No se accedió a la fuente primaria. Citar con cautela y verificar antes de usar en público.Reporte secundario
  13. IndustriaAnthropic. «Effective Context Engineering for AI Agents». Septiembre de 2025. Literatura académica relacionada: «A Survey of Context Engineering for Large Language Models».anthropic.com/engineeringarXiv 2507.13334
  14. PreprintKalai, A. T., Nachum, O., Vempala, S. S. y Zhang, E. «Why Language Models Hallucinate». OpenAI y Georgia Tech, septiembre de 2025. Argumento estadístico y de incentivos. Fuente de la analogía del examen y de la propuesta de modificar la puntuación de los benchmarks dominantes.arxiv.org/abs/2509.04664Presentación
  15. PreprintLiteratura sobre adulación en modelos de lenguaje. 2025-2026. Incluye «Measuring Sycophancy of Language Models in Multi-turn Dialogues» (EMNLP Findings 2025), el benchmark PARROT y trabajos sobre separación causal de comportamientos aduladores. Fuente de la tasa promedio de 63,7 %, del rango 46,6-95,1 % y de la mejora de hasta 64 % con instrucciones explícitas.ACL AnthologyarXiv 2511.17220
  16. Revisado por paresDell'Acqua, F., McFowland III, E., Mollick, E. R., Lifshitz-Assaf, H., Kellogg, K., Rajendran, S., Krayer, L., Candelon, F. y Lakhani, K. R. «Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality». Organization Science. 758 consultores de BCG. Preregistrado.Harvard Business SchoolPDF accesible
  17. Revisado por paresLiu, N. F. et al. «Lost in the Middle: How Language Models Use Long Contexts». Transactions of the ACL, 2024.arxiv.org/abs/2307.03172
  18. IndustriaChroma Research. «Context Rot». Julio de 2025. 18 modelos de frontera evaluados; degradación en todos, con caídas abruptas anteriores al límite nominal de la ventana.Síntesis secundaria
  19. Revisado por paresBrynjolfsson, E., Li, D. y Raymond, L. «Generative AI at Work». Quarterly Journal of Economics 140(2), pp. 889-942, 2025. 5.179 agentes de atención al cliente, despliegue escalonado en producción.QJENBER w31161
  20. Revisado por paresNoy, S. y Zhang, W. «Experimental evidence on the productivity effects of generative artificial intelligence». Science, julio de 2023. 453 profesionales universitarios. Fuente del desplazamiento de la tarea desde el borrador hacia idea y edición.SciencePDF
  21. IndustriaMcKinsey. «State of AI 2026: Shifting to the agentic era». 1.993 líderes en 105 países. 39 % con algún impacto en EBIT; ~6 % de alto desempeño; 23 % escalando sistemas agénticos y 62 % experimentando; seguridad y riesgo como barrera principal.mckinsey.com
  22. IndustriaStanford HAI. «AI Index Report 2026». Inversión corporativa global de US$ 581.700 M en 2025 (+130 %); adopción poblacional del 53 % en tres años; agentes en tareas reales de 20 % a 77,3 %; índice de transparencia de modelos fundacionales en descenso de 58 a 40 puntos.ReporteDoce conclusiones
  23. IndustriaMIT Project NANDA. «The GenAI Divide: State of AI in Business 2025». Base: +300 iniciativas públicas, 52 entrevistas, 153 respuestas de encuesta. Véase la advertencia metodológica de §6.3.PDF
  24. PreprintBrynjolfsson, E., Chandar, B. y Chen, R. «Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of Artificial Intelligence». Stanford Digital Economy Lab, con actualización de febrero de 2026. Datos administrativos de alta frecuencia. Caída relativa del empleo de 13-16 % en trabajadores de 22-25 años en ocupaciones expuestas donde la tecnología automatiza; estabilidad o crecimiento donde aumenta.Stanford Digital Economy Lab
  25. IndustriaAnthropic. «Anthropic Economic Index», reportes de 2026. Aumentación 52 % frente a automatización 45 %; concentración de las diez tareas principales bajando de 24 % a 19 %; ~49 % de las ocupaciones con al menos un cuarto de sus tareas asistidas.Reporte de junio de 2026Reporte de marzo de 2026
  26. IndustriaRelevamientos de adopción en América Latina y Argentina. 2026. Incluye la encuesta nacional de nadIA con apoyo del BID y la Fundación Observatorio PyME sobre 402 empresas industriales y de software. 47 % de adopción empresarial regional; Argentina 68 %; tercer puesto global en uso individual regular con 29 %.Encuesta nadIASíntesis regional
  27. Revisado por paresDoshi, A. R. y Hauser, O. P. «Generative AI enhances individual creativity but reduces the collective diversity of novel content». Science Advances 10(28), 2024.Science AdvancesRepositorio UCL
  28. SecundariaRelevamientos de costos de generación de video y adopción publicitaria. 2026. Costos por segundo entre US$ 0,05 y US$ 0,75 según nivel; comparación contra rangos de producción tradicional. Cifras de proveedores y agregadores: útiles como orden de magnitud, no como medición.Comparativa de preciosPanorama del mercado
  29. Revisado por paresInvestigación sobre divulgación de IA en publicidad y confianza del consumidor. 2026. Incluye «Transparency Disclosure Mechanisms for AI-Generated Advertising on Online Platforms» (Internet Technology Letters, 2026) y revisiones sistemáticas sobre confianza en contenido de marketing generado por IA, junto con relevamientos del IAB. Fuente del «dilema de la divulgación».Internet Technology LettersIAB
  30. SecundariaPrensa sectorial sobre reestructuración de holdings publicitarios. 2026. Fusión Omnicom-IPG; plan de reestructuración de WPP; divergencia entre crecimiento de la inversión publicitaria (+8,6 %) y caída de ingresos de holdings (−1,2 %).Storyboard18eMarketer
  31. Normativa vigenteReglamento de Inteligencia Artificial de la Unión Europea, artículo 50. Obligaciones de transparencia exigibles desde el 2 de agosto de 2026. Sanciones de hasta €15 M o 3 % de la facturación mundial anual. Transitorio de marcado hasta el 2 de diciembre de 2026; alto riesgo del Anexo III desde el 2 de diciembre de 2027.Texto y guía del artículo 50Cronograma oficial de la Comisión Europea
  32. SecundariaAnálisis jurídico sobre litigios de derechos de autor e IA. 2026. Más de setenta acciones activas; criterio emergente de competencia de mercado; no registrabilidad de obras puramente generadas y el prompt como insuficiente para constituir autoría.Norton Rose FulbrightAI Business
  33. IndustriaPráctica de evaluación automatizada en producción. 2026. Concordancia con revisores humanos en torno al 85 %; costo por evaluación de fracciones de centavo frente a US$ 5-50 por instancia en revisión humana.Arize AIDeepEval
  34. IndustriaDakan, R. (Ringling College) y Feller, J. (University College Cork), con Anthropic. «AI Fluency: Framework & Foundations». Marco de las cuatro competencias. Curso gratuito con certificación.Anthropic AcademyCoursera
Sobre el uso de estas fuentes

Las entradas marcadas como secundarias no deben presentarse en público como si fueran mediciones. Sirven para dar contexto y orden de magnitud. Cuando una cifra vaya a decirse frente a una audiencia que puede repreguntar, conviene que provenga de una entrada verde o, en su defecto, que se la enuncie junto con su procedencia. Ese hábito —decir de dónde sale cada número— es lo que sostiene la credibilidad del conjunto.