IA agéntica frente a IA generativa: qué cambia en la gobernanza

IA agéntica frente a IA generativa: un pantógrafo cuyo brazo enlazado dibuja solo

Lo esencial

  • La IA generativa entrega un resultado que usted revisa. La IA agéntica entrega un acto ya consumado cuando usted lo mira. De ese único desplazamiento se deriva todo lo demás.
  • Los agentes no constituyen una categoría jurídica nueva: el artículo 3, apartado 1 del Reglamento europeo de IA ya alcanza a los sistemas dotados de niveles de autonomía variables.
  • La frontera entre IA agéntica y IA generativa es un gradiente, no un interruptor. Gobiérnela por grado de agencia: acceso a herramientas, memoria, planificación propia, efecto no revisado y traspaso entre agentes.
  • Su registro de riesgos no cambia de gravedad, cambia de categoría. La inyección de prompt deja de ser un problema de texto y pasa a ser un problema de transacción no autorizada.
  • Su expediente probatorio también cambia: los registros de prompts ya no bastan, porque el auditor exigirá los registros de acciones, la identidad con la que actuó el agente y la prueba de que el mecanismo de parada funciona.

IA agéntica frente a IA generativa: la diferencia que desplaza sus obligaciones

Si pide a un proveedor que le explique la IA agéntica, obtendrá en todas partes la misma frase: la IA generativa crea contenido, la IA agéntica ejecuta acciones. Es exacta y no sirve de nada a quien debe autorizar una puesta en producción. La versión útil es más estrecha. La IA generativa deja un borrador ante una persona, y es esa persona quien decide si llega a ser real. La IA agéntica cierra ese intervalo: planifica una secuencia, invoca una herramienta, escribe en un sistema de gestión y rinde cuentas. El resultado y el efecto llegan juntos. Sin embargo, en ese intervalo se alojaba todo aquello sobre lo que la gobernanza se apoyaba en silencio: el paso de revisión, la constancia de aprobación y la oportunidad de interceptar una respuesta errónea antes de que costara algo. Si elimina el intervalo, los controles no fallan de forma ruidosa. Sencillamente dejan de estar donde está el riesgo. El legislador europeo no lo pasó por alto. El artículo 3, apartado 1 define un sistema de IA como un sistema basado en máquinas que funciona con niveles de autonomía variables y que infiere resultados capaces de influir en entornos físicos o virtuales. La autonomía figura ya en la definición. Un agente no es, por tanto, un objeto jurídico inédito, sino el mismo objeto con el mando subido, razones por las cuales las obligaciones no cambian de identidad sino de peso.

La pila de capacidades que genera la brecha

La Agentic Security Initiative de OWASP describe un agente a partir de cuatro capacidades: planificación y razonamiento, memoria y persistencia de estado, uso de herramientas y acción. Cada una constituye tanto una superficie de gobernanza como una superficie técnica.

  • La planificación implica que el sistema escogió pasos que usted nunca enumeró, de modo que un análisis de riesgos construido sobre una lista exhaustiva de conductas previstas deja de sostenerse.
  • La memoria implica que el estado persiste entre ejecuciones, por lo que una entrada contaminada puede alterar el comportamiento mucho después de cerrada la sesión que la introdujo.
  • El uso de herramientas implica que el radio de acción es el que permiten las credenciales, no el que permite el cuadro de texto.
  • La acción implica que el efecto es real antes de ser revisado.

Un modelo de IA generativa posee la primera capacidad en forma débil y ninguna de las otras tres. En eso consiste toda la brecha, y cada apartado que sigue no es sino una consecuencia suya.

La prueba de las cinco preguntas: ¿su despliegue ya cruzó la línea?

Muy pocos equipos deciden construir un agente. Añaden una llamada a herramienta en un asistente conversacional, luego un bucle de reintento, después un planificador, y un sprint más tarde la cosa escribe en producción. El cruce rara vez es una decisión, lo que explica que rara vez active una revisión de gobernanza. Aplique estas cinco preguntas a cada sistema del que responda.

  1. ¿Puede invocar una herramienta, una API o una base de datos sin que una persona apruebe esa llamada concreta? Si es así, su punto de control se ha desplazado del resultado al permiso.
  2. ¿Conserva un estado entre pasos o sesiones capaz de modificar su conducta posterior? Si es así, posee un activo corruptible, que exige controles de integridad y no solo controles de acceso.
  3. ¿Descompuso el objetivo en pasos que usted no definió? Si es así, su análisis de riesgos ya no puede avanzar conducta por conducta y debe avanzar frontera por frontera.
  4. ¿Puede su resultado surtir efecto sin que alguien lo revise antes? Si es así, la supervisión pasa a ser un problema de diseño y deja de ser uno de proceso.
  5. ¿Traspasa trabajo a otro agente o lo recibe de él? Si es así, está gobernando un sistema, y los fallos interesantes se alojan en la interacción y no en un componente aislado.

Un sí no constituye una alarma. Cinco sí describen un sistema distinto del que refleja su documentación. El encuadre más sólido procede del Center for Long-Term Cybersecurity de la Universidad de Berkeley, cuyo Agentic AI Risk-Management Standards Profile sostiene que la gobernanza debe escalar con el grado de agencia en lugar de tratar la autonomía como un atributo binario. Anote la puntuación de las cinco respuestas en el inventario y deje que sea ella la que determine cuánto pesan los controles. Un campo que diga « autónomo: sí o no » no sobrevive al encuentro con una cartera real. Es también el punto en que la shadow AI deja de ser un problema de descubrimiento para convertirse en uno de clasificación. Un equipo que hace diéciocho meses registró su herramienta como asistente de redacción no rehará la ficha por iniciativa propia porque alguien haya activado las llamadas a función.

Qué cambia en la clasificación

Aquí la distinción produce su primera consecuencia jurídica concreta, y lo hace en dos ejes a la vez. El análisis de The Future Society sobre cómo el Reglamento alcanza a los agentes, Ahead of the Curve (Oueslati y Staes-Polet, 2025), expone ambos. El capítulo V alcanza al modelo de propósito general situado bajo el agente: los proveedores de modelos con riesgo sistémico han de evaluar y mitigar los riesgos derivados de integrar esos modelos en sistemas agénticos. El capítulo III alcanza al propio sistema agéntico, a través de la clasificación de alto riesgo. De ahí se siguen tres consecuencias, y cada una sorprende a alguien. En primer lugar, la calificación de alto riesgo de un agente polivalente sigue siendo genuinamente incierta. El anexo III se redactó antes de que los riesgos agénticos se comprendieran bien, y un agente que puede orientarse hacia muchas tareas corre el riesgo de entrar en el ámbito por defecto, salvo exclusión deliberada de los usos de alto riesgo por parte del proveedor. Deliberada significa documentada y aplicada técnicamente, no una línea en una política de uso. Quien aborde este punto conviene que parta del método de clasificación de sistemas de alto riesgo y lo aplique al uso más amplio que el agente pueda alcanzar, no al previsto. En segundo lugar, el andamiaje que usted añade puede cambiar su condición jurídica. Envolver un modelo de gran escala en una capa de recuperación documental, un marco de orquestación y un conjunto de herramientas puede configurar una modificación sustancial, lo que traslada obligaciones de proveedor a un equipo que había presupuestado obligaciones de responsable del despliegue. La factura de cumplimiento resulta entonces sensiblemente distinta, y suele aterrizar en un grupo de ingeniería que jamás abrió el capítulo V. En tercer lugar, la clasificación debe rehacerse. Una capacidad agéntica añadida a un despliegue generativo existente no es un salto de versión: a efectos de clasificación se trata de un sistema nuevo, y el trabajo de conformidad vuelve a empezar por el análisis de riesgos en lugar de retomarse en el último visto bueno.

Qué cambia en la supervisión humana

El artículo 14 exige que los sistemas de alto riesgo se diseñen de modo que personas físicas puedan supervisarlos con eficacia, con medidas proporcionadas a los riesgos, al grado de autonomía y al contexto de uso. Leída pensando en un agente, la dificultad salta a la vista: la norma eleva sus exigencias justo al elevarse la propiedad que vuelve arduo satisfacerlas. La supervisión de un sistema generativo cuesta poco porque es síncrona: alguien lee y después actúa. La supervisión de un sistema agéntico cuesta mucho porque la acción ya ocurrió, de modo que debe diseñarse dentro de la ruta de ejecución y no superponerse después. De ahí se derivan tres cambios concretos para la supervisión humana del artículo 14. El punto de control sustituye a la relectura. La supervisión pasa de leer un resultado a autorizar de antemano clases de acciones y a interrumpir acciones concretas mientras se ejecutan. Se trata de un modelo de permisos, y merece el mismo cuidado de diseño que el propio prompt. El modo de supervisión se desplaza, aunque no en todas partes. Pasar del human-in-the-loop al human-on-the-loop es la decisión correcta para procesos de alto volumen y baja consecuencia. Es la equivocada cuando una decisión produce efectos jurídicos o significativos sobre una persona, pues el artículo 22 del RGPD sigue limitando la decisión íntegramente automatizada con independencia de cómo el Reglamento de IA clasifique el sistema. La AEPD ha recordado en diversas ocasiones que la intervención humana invocada ha de ser real y contar con capacidad efectiva de modificación. La supervisión debe sobrevivir a su propio volumen. OWASP cataloga este punto como T10, Overwhelming Human-in-the-Loop, y es el más subestimado de la lista. Una cola de aprobación que un revisor despacha a razon de cuatrocientos elementos por hora no es supervisión: es un sello acompañado de pista de auditoría. Cuando un control depende de una atención que el ritmo vuelve imposible, el control ya ha fallado, y sus evidencias documentarán ese fallo.

Qué cambia en el registro de riesgos

Es el apartado que la mayoría de las comparativas omite, y aquel en que la diferencia deja de ser conceptual. Los modos de fallo no empeoran: cambian de categoría. Un registro generativo versa sobre todo acerca de lo que el sistema dice: alucinación, fuga de confidencialidad, resultado discriminatorio o tóxico, inyección de prompt como problema de contenido. Un registro agéntico versa sobre lo que el sistema hace. La taxonomía de OWASP recoge quince amenazas agénticas, entre ellas el envenenamiento de memoria, el abuso de herramientas, la elevación de privilegios, la alucinación en cascada, la manipulación del objetivo, el repudio y la falta de trazabilidad, así como los agentes descontrolados dentro de sistemas multiagente. La frase que conviene llevar a su comité de riesgos cabe en una línea: la inyección de prompt deja de ser un problema de frase incorrecta y pasa a ser un problema de transacción no autorizada. El mismo ataque, otra clase de consecuencia, otro responsable. <table header-row=»true»> <tr> <td>Modo de fallo</td> <td>En IA generativa</td> <td>En IA agéntica</td> <td>En qué se convierte el control</td> </tr> <tr> <td>Inyección de prompt</td> <td>Texto contrario a la política o embarazoso</td> <td>Llamada a herramienta no autorizada, exfiltración, ejecución de código</td> <td>Fronteras de confianza en la entrada y privilegio mínimo en las herramientas</td> </tr> <tr> <td>Alucinación</td> <td>Una afirmación errónea que un revisor intercepta</td> <td>Una acción errónea ya ejecutada, sobre la que se apoyan los pasos siguientes</td> <td>Validación de la acción y reversibilidad, no solo revisión del resultado</td> </tr> <tr> <td>Fuga de datos</td> <td>Texto sensible en una respuesta</td> <td>Datos movidos entre sistemas por el propio agente</td> <td>Control de salida en la capa de herramientas</td> </tr> <tr> <td>Corrupción de memoria</td> <td>No aplicable</td> <td>Un estado envenenado orienta la conducta a lo largo de varias sesiones</td> <td>Validación de memoria y aislamiento de sesiones</td> </tr> <tr> <td>Identidad</td> <td>Una cuenta de servicio, un patrón de llamada</td> <td>Una identidad no humana que actúa de continuo sobre varios sistemas</td> <td>Identidad de agente, credenciales acotadas, imputabilidad completa</td> </tr> <tr> <td>Acumulación</td> <td>Contenida en una respuesta</td> <td>Fallo en cascada entre pasos o entre agentes</td> <td>Evaluación a nivel de sistema, cortacircuitos, contención</td> </tr> </table> El perfil de Berkeley añade los riesgos de cola que importan en grados altos de agencia: pérdida de control, elusión de la supervisión, desalineamiento engañoso y fallos multiagente en cascada. Formula además un principio que merece entrar en sus revisiones de diseño: un sistema multiagente debe evaluarse tanto por agente como en conjunto, porque los efectos emergentes de la interacción no aparecen en las pruebas de componente. Su recomendación más directa consiste en tratar a un agente suficientemente capaz como no fiable y contenerlo en consecuencia. Dos consecuencias prácticas para los programas ya en marcha. Su metodología de gestión de riesgos de IA debe evaluar a nivel de sistema, pues el examen agente por agente pasará por alto los fallos de interacción. Y el red teaming de IA debe apuntar a la frontera de herramientas y al almacén de memoria, y no solo al prompt, porque es por ahí por donde un agente se rompe de verdad.

Qué cambia en las pruebas que debe producir

El cumplimiento no es lo que usted cree de su sistema, sino lo que sabe mostrar. En este terreno ambos paradigmas divergen con nitidez, y los equipos descubren la brecha por lo común durante una auditoría y no antes. Para un despliegue generativo, el expediente resulta familiar: documentación del modelo, resultados de evaluación, registros de prompts y salidas, y constancia de la revisión humana. Para un despliegue agéntico, el registro de eventos previsto en el artículo 12 debe sostener bastante más. Quien reconstruya una sola decisión del agente necesita el objetivo encomendado, el plan generado, cada llamada a herramienta con sus parámetros y su resultado, la identidad con la que se actuó, el permiso que amparaba la llamada, si la acción era reversible y si se revirtió, y dónde se situaba el punto de control humano. OWASP archiva la incapacidad de aportar esa cadena como T8, repudio y falta de trazabilidad, y la trata como amenaza de seguridad. Es igualmente un fallo de gobernanza. Si no puede vincular una acción a un agente, una versión y un permiso habilitante, no podrá responder ni a un regulador, ni a un auditor, ni a un reclamante, y será la ausencia del registro la que se convierta en el hallazgo. Tres artefactos que añadir y que un despliegue generativo nunca necesitó:

  • Una decisión documentada de seguir o no seguir antes del despliegue, que el perfil de Berkeley sitúa en Manage 1.1. Por escrito, con las condiciones que la revertirían.
  • La prueba de que la ruta de desconexión funciona, ensayada y no afirmada. Un botón de parada que nadie ha accionado en un simulacro sigue siendo una intención de diseño, no un control.
  • Un inventario de identidades no humanas, para que cada acción del agente se resuelva en una credencial, un alcance y un responsable.

Es asimismo el momento en que su documentación técnica y su procedimiento de notificación de incidentes piden una reescritura antes que una ampliación, pues ambos se concibieron en torno a un sistema que produce resultados y no efectos.

Qué cambia en la cadena de valor

La dificultad mayor no es técnica. The Future Society la denomina el problema de las muchas manos: cuando el agente actúa, han intervenido tantas partes que la responsabilidad se dispersa, salvo que alguien la asigne de forma deliberada. Tres actores, con recursos, competencias e información de contexto asimétricos. El proveedor del modelo construye la capacidad subyacente y los medios que hacen posible la gobernanza. El proveedor del sistema agéntico la adapta a una finalidad y fija los límites correspondientes. El responsable del despliegue la ejecuta sobre datos reales, usuarios reales y consecuencias reales. La monitorización ofrece la ilustración más nítida. El proveedor del modelo ha de construir una infraestructura de monitorización configurable. El proveedor del sistema ha de fijar umbrales de alerta adecuados al caso de uso. El responsable del despliegue ha de leer efectivamente las alertas y actuar sobre ellas. Cualquiera de los tres actuando en solitario produce algo que en un diagrama parece supervisión y en explotación no lo es. Para la mayoría de las organizaciones la pregunta práctica es qué exigir a un proveedor que vende un agente. Cuatro puntos pertenecen al contrato: el esquema y la conservación de los registros que recibirá, la granularidad con la que puede acotar los permisos del agente, el mecanismo de desconexión y su latencia medida, y los deberes de notificación cuando el modelo o el andamiaje cambien bajo sus pies. Trate estos elementos como puntos de due diligence de proveedores con el mismo peso que las preguntas de seguridad, porque un cambio de capacidad entregado en silencio es un cambio de clasificación que usted no decidió. Lo que no se delega es el deber del responsable del despliegue. El riesgo ligado al contexto, la posición ante los derechos fundamentales y el diseño de la supervisión permanecen en la organización que explota el sistema: es el hilo conductor de la responsabilidad en materia de IA en cuanto los agentes entran en el parque.

La lista de comprobación del cruce

Diez acciones cuando un despliegue cruza la línea. Cada una es verificable, lo que importa más que lo cómoda que resulte.

  1. Rehacer la clasificación sobre el uso más amplio alcanzable, no sobre el previsto.
  2. Consignar en el inventario una puntuación de grado de agencia y abandonar el indicador binario de autonomía.
  3. Repetir el análisis de riesgos a nivel de sistema, incluidas las interacciones entre agentes.
  4. Registrar cada agente como identidad no humana con un responsable nombrado.
  5. Acotar los permisos sobre herramientas al privilegio mínimo y fijar el radio de acción de forma deliberada en vez de heredarlo.
  6. Instrumentar un registro por acción que recoja objetivo, plan, llamada a herramienta, identidad y reversibilidad.
  7. Definir y ensayar la ruta de desconexión, conservando la constancia del ensayo.
  8. Rediseñar el punto de control humano para que sobreviva al ritmo de producción.
  9. Renegociar el contrato con el proveedor sobre registros, permisos, parada de emergencia y notificación de cambios.
  10. Extender el procedimiento de incidentes a las acciones ejecutadas por el agente, y no solo a los resultados producidos.

Quien hoy lleva todo esto en hojas de cálculo suele encontrar en el paso agéntico el límite del método, porque la prueba pasa a ser continua en lugar de periódica. Ese es precisamente el problema para el que existe una plataforma de gestión de riesgos de IA.

Preguntas frecuentes

¿ChatGPT es IA generativa o IA agéntica? Ambas, según la configuración. Empleado como interfaz conversacional que devuelve texto para leer, el producto es generativo. Dotado de herramientas, navegación, ejecución de código o conectores, y autorizado a encadenar pasos hacia un objetivo, el mismo producto se comporta de manera agéntica. Por eso la pregunta no se resuelve en el nivel de un nombre comercial, sino en el de su configuración, sus herramientas habilitadas y sus permisos. Dos empresas con la misma suscripción pueden soportar así obligaciones muy distintas. ¿Qué diferencia hay entre un agente de IA y la IA agéntica? El perfil de Berkeley traza una línea útil. Un agente de IA designa un único modelo dotado de herramientas para completar una tarea bien delimitada de principio a fin. La IA agéntica designa un sistema de varios agentes coordinados hacia objetivos más amplios. La distinción gobierna la evaluación: un agente aislado se evalúa en buena medida por sí solo, mientras que un sistema multiagente debe evaluarse por agente y en conjunto, ya que los fallos más graves emergen de la interacción y no de un componente defectuoso. ¿Puede dar un ejemplo de IA agéntica? Un asistente de compras que lee una factura entrante, la coteja con el pedido, consulta la ficha del proveedor, señala una discrepancia y deposita una instrucción de pago aprobada en el sistema financiero. Cada paso es corriente. La combinación es agéntica porque el sistema planificó la secuencia, empleó varias herramientas y produjo un efecto financiero sin que una persona aprobara ese pago concreto. La versión generativa del mismo asistente habría redactado un resumen para que actuara un administrativo. ¿La IA agéntica es de alto riesgo según el Reglamento europeo? No de forma automática, y no por ser agéntica. La calificación depende de la finalidad, de si el sistema es componente de seguridad o de si encaja en un ámbito del anexo III. La complicación reside en que un agente polivalente puede alcanzar muchas finalidades, y los análisis publicados advierten de que tal sistema podría entrar en el ámbito por defecto salvo exclusión deliberada y demostrable de los usos de alto riesgo. Clasifique según lo que el agente puede alcanzar y trate la exclusión como un control técnico acreditable y no como una declaración de política. ¿Requiere un análisis de riesgos distinto del de una IA generativa? Sí, y no simplemente más extenso. Un análisis generativo se centra en gran medida en el resultado y se pregunta qué podría decir el sistema y quién podría sufrirlo. Un análisis agéntico ha de centrarse en la acción y realizarse a nivel de sistema: qué puede alcanzar el agente, qué puede modificar, qué ocurre cuando un paso falla a mitad de camino y cómo se acumulan los fallos entre pasos o entre agentes. El perfil de Berkeley vincula este recorrido a las funciones del NIST AI RMF, lo que permite a la mayoría de las organizaciones ampliar un método existente en lugar de adoptar uno nuevo. ¿Hace falta una política de IA aparte para los agentes? Rara vez un documento separado, aunque el existente reclama cláusulas nuevas: quién puede conceder a un agente acceso a una herramienta y bajo qué aprobación, qué clases de acción exigen siempre un punto de control humano, qué obligaciones de registro e identidad se aplican, y qué suceso dispara una reclasificación al activarse una capacidad agéntica. Incorporar esas cláusulas a su política de IA preserva un único documento exigible en lugar de dos textos en competencia.

Conclusión

La comparativa que todo el mundo publica es correcta y se detiene un peldaño antes de tiempo. La IA generativa crea, la IA agéntica actúa, y la pregunta interesante es qué le cuesta a usted. Cuesta una reclasificación, porque el conjunto de usos alcanzables se ha ampliado. Cuesta un rediseño de la supervisión, porque el artículo 14 exige más justo cuando la autonomía vuelve más difícil satisfacerlo. Cuesta un registro de riesgos nuevo, porque los modos de fallo han cambiado de categoría. Cuesta un expediente probatorio más pesado, porque el auditor pregunta ahora qué hizo el sistema y bajo qué autoridad. Y cuesta una relación renegociada con el proveedor, porque la parte que modifica la capacidad rara vez es la que soporta la consecuencia. Nada de esto es un argumento contra los agentes. Todo ello es un argumento a favor de saber con exactitud cuándo adquirió usted uno. Aplique las cinco preguntas a su cartera este trimestre y compruebe qué parte ha cruzado ya la línea. Si quiere mantener la clasificación, el diseño de la supervisión, el registro de riesgos y el rastro probatorio en un mismo lugar y no en cinco hojas de cálculo, para eso existe AI Sigil.

Ley de transparencia de IA de California: qué exige SB 942

La ley de transparencia de IA de California se aplica desde el 2 de agosto de 2026. Obligaciones de SB 942, cambios de SB 1000 y pruebas que conservar.

IA agéntica frente a IA generativa: qué cambia en la gobernanza

La IA agéntica no es solo una diferencia técnica. Vea qué cambia en clasificación, supervisión, riesgos y pruebas cuando la IA actúa sola.

Normativa CCPA: ADMT, riesgos y auditorías hasta 2030

La normativa CCPA exige evaluaciones de riesgos desde 2026 y, antes del 1 de enero de 2027, aviso, exclusión y acceso para la ADMT. Calendario, multas y plan.

¿Qué es la IA adversaria? Ataques, defensas y gobernanza

La IA adversaria engaña a los modelos de machine learning con envenenamiento, evasión e inyección de prompts. Tipos de ataque, defensas y qué exige la Ley de IA.

Leyes de IA en California: quién debe cumplirlas y cuándo

Leyes de IA en California por rol y plazo: SB 53, SB 942, SB 243, reglas de la CCPA sobre ADMT y las leyes firmadas por Newsom en septiembre de 2026.

Ley TRAIGA: el derecho texano de la IA ya en aplicación

La ley TRAIGA se aplica desde enero de 2026. Qué prohíbe el derecho texano, cómo funciona la eximente basada en el NIST AI RMF y qué pruebas debe conservar.