Seguridad ante IA

OWASP LLM Top 10: los 10 riesgos de seguridad en IA generativa

La lista de referencia mundial sobre los riesgos de seguridad en aplicaciones con modelos de lenguaje. Qué es cada riesgo, cómo se explota y cómo se mitiga, con ejemplos concretos.

01/06/2026 · Lectura ~12 min · Tech del Fuego

Cada vez más empresas integran modelos de lenguaje grandes (LLMs) en sus operaciones: chatbots de atención al cliente, asistentes internos, automatización de documentos, análisis de texto. Y cada integración abre una superficie de ataque nueva que la seguridad tradicional no contempla.

El OWASP LLM Top 10 es la respuesta de la industria a ese problema. OWASP, la organización detrás del célebre OWASP Top 10 de aplicaciones web, publicó una lista equivalente para los riesgos específicos de la IA generativa. Es hoy el marco de referencia mundial para construir y adoptar IA de forma segura.

En Tech del Fuego usamos esta lista como base de nuestras evaluaciones de seguridad ante IA. Acá te explicamos los diez riesgos, sin jerga innecesaria, con ejemplos y mitigaciones concretas.

En una frase: el OWASP LLM Top 10 te dice dónde se rompe la seguridad cuando incorporás IA generativa, para que puedas anticiparte en vez de reaccionar.

LLM01: Prompt Injection

El riesgo número uno. Consiste en inyectar instrucciones en el texto que procesa el modelo para alterar su comportamiento: forzarlo a revelar datos, ignorar sus reglas o ejecutar acciones no autorizadas. Puede ser directo (un usuario malicioso escribe la instrucción) o indirecto (la instrucción viene escondida en un documento, una página web o un correo que el modelo lee).

Es el riesgo más difícil de eliminar porque los LLMs no distinguen de forma confiable entre una instrucción legítima y una maliciosa dentro del mismo texto. Lo cubrimos en profundidad en nuestro artículo qué es prompt injection.

Mitigación: validación y sanitización de entradas, segmentación de contexto, principio de menor privilegio en las acciones que el modelo puede ejecutar, y revisión humana en operaciones sensibles.

LLM02: Divulgación de información sensible

El modelo expone datos que no debería: información personal, secretos comerciales, credenciales o fragmentos de su prompt de sistema. Puede pasar porque el modelo fue entrenado o alimentado con datos sensibles, o porque un atacante lo manipula para extraerlos.

Para las empresas, este es el riesgo más cercano: cuando un empleado pega información confidencial en una herramienta de IA, esa información puede salir de su control. Lo desarrollamos en fuga de datos por ChatGPT.

Mitigación: sanitización de datos antes de enviarlos al modelo, políticas claras de uso aceptable, controles de acceso y, cuando la sensibilidad lo exige, modelos que corran en infraestructura propia.

LLM03: Riesgos en la cadena de suministro

Los componentes de un sistema de IA (modelos preentrenados, datasets, librerías, plugins) vienen de terceros. Si alguno está comprometido o tiene una licencia problemática, el riesgo se hereda. Un modelo descargado de un repositorio público puede contener puertas traseras o sesgos inyectados deliberadamente.

Mitigación: inventario de componentes, verificación de procedencia, uso de proveedores confiables y evaluación de modelos de terceros antes de ponerlos en producción.

LLM04: Envenenamiento de datos y del modelo

Un atacante manipula los datos de entrenamiento o de ajuste fino para introducir vulnerabilidades, sesgos o comportamientos ocultos. El modelo aprende algo que no debería y actúa de forma comprometida ante ciertos disparadores.

Mitigación: control de la procedencia de los datos, validación de datasets, detección de anomalías y trazabilidad de qué datos alimentaron cada versión del modelo.

LLM05: Manejo inadecuado de las salidas

La salida de un LLM se trata como confiable y se pasa directamente a otro sistema sin validar. Si el modelo genera código, comandos o HTML, y eso se ejecuta o renderiza sin control, abrís la puerta a inyección de código, XSS o ejecución remota.

Mitigación: tratar toda salida del modelo como input no confiable. Validar, escapar y sanitizar antes de usarla en cualquier sistema posterior.

LLM06: Agencia excesiva

Cuando se le da al modelo más permisos, herramientas o autonomía de la necesaria. Si un agente de IA puede borrar registros, enviar correos o hacer pagos, un error o una manipulación se vuelven peligrosos. Este riesgo crece con la adopción de agentes autónomos, que tratamos en seguridad en agentes de IA.

Mitigación: principio de menor privilegio, aprobación humana para acciones críticas, límites explícitos de lo que el agente puede hacer y registro de cada acción.

LLM07: Filtración del prompt de sistema

El prompt de sistema (las instrucciones que definen cómo se comporta el modelo) se expone. A veces contiene credenciales, reglas de negocio o información que debería quedar oculta. El error de fondo no es solo que se filtre, sino haber puesto secretos ahí en primer lugar.

Mitigación: nunca incluir secretos ni credenciales en el prompt de sistema. Asumir que puede filtrarse y diseñar la seguridad sin depender de su confidencialidad.

LLM08: Debilidades en vectores y embeddings

Afecta a los sistemas RAG (Retrieval Augmented Generation), donde el modelo consulta una base de conocimiento vectorial. Si esa base no tiene controles de acceso adecuados, un usuario puede recuperar información de otro, o un atacante puede inyectar contenido malicioso en los embeddings.

Mitigación: controles de acceso a nivel de documento en la base vectorial, validación del contenido que se indexa y aislamiento entre clientes o áreas.

LLM09: Desinformación

Los LLMs generan información falsa con total seguridad: las famosas alucinaciones. Si una empresa toma decisiones, da respuestas a clientes o genera documentos basándose en salidas no verificadas, propaga errores que pueden tener costo legal o reputacional.

Mitigación: verificación humana de las salidas críticas, sistemas RAG que citen fuentes, y comunicar claramente a los usuarios que el contenido es generado por IA y puede contener errores.

LLM10: Consumo sin límites

Un atacante satura el sistema con peticiones para degradar el servicio o inflar costos. Como cada llamada a un LLM cuesta dinero, un abuso no controlado puede generar una factura enorme o tirar abajo el servicio (una variante de denegación de servicio).

Mitigación: límites de tasa (rate limiting), cuotas por usuario, monitoreo de consumo y alertas de costos anómalos.

Resumen: los 10 riesgos de un vistazo

Código Riesgo Mitigación clave
LLM01Prompt InjectionValidación de entradas, menor privilegio
LLM02Divulgación de información sensibleSanitización, políticas de uso
LLM03Cadena de suministroProcedencia y proveedores confiables
LLM04Envenenamiento de datosControl de datasets, trazabilidad
LLM05Manejo inadecuado de salidasTratar salidas como input no confiable
LLM06Agencia excesivaMenor privilegio, aprobación humana
LLM07Filtración del prompt de sistemaNo poner secretos en el prompt
LLM08Debilidades en embeddingsControl de acceso en la base vectorial
LLM09DesinformaciónVerificación humana, citar fuentes
LLM10Consumo sin límitesRate limiting, monitoreo de costos

Cómo empezar a aplicar el OWASP LLM Top 10 en tu empresa

No hace falta abordar los diez riesgos de golpe. El orden práctico para una empresa que recién adopta IA es:

  1. Política de uso aceptable de IA: qué se puede y qué no se puede pegar en herramientas como ChatGPT. Cubre LLM02 de entrada.
  2. Capacitación del equipo: que entiendan prompt injection, alucinaciones y manejo de datos sensibles. Cubre LLM01 y LLM09.
  3. Controles técnicos en las aplicaciones propias: validación de entradas y salidas, menor privilegio en agentes. Cubre LLM01, LLM05 y LLM06.
  4. Gobernanza: marcos como NIST AI RMF e ISO/IEC 42001 para institucionalizar todo lo anterior. Lo vemos en gobernanza de IA.

El error más común: creer que adoptar IA es solo una decisión de productividad. Es también una decisión de seguridad. La empresa que lo entiende temprano evita los costos de aprenderlo tarde.

En Tech del Fuego evaluamos la postura de seguridad ante IA de empresas en Argentina usando el OWASP LLM Top 10, el NIST AI RMF y la norma ISO/IEC 42001. Si tu empresa está adoptando IA y querés hacerlo sobre bases sólidas, agendá un diagnóstico gratuito.

Preguntas frecuentes

¿Qué es el OWASP LLM Top 10?

Es la lista de referencia mundial de los diez riesgos de seguridad más críticos en aplicaciones que usan modelos de lenguaje grandes (LLMs como ChatGPT, Claude o Gemini). La publica OWASP, la misma organización detrás del clásico OWASP Top 10 de aplicaciones web. Sirve como marco para evaluar y mitigar riesgos al construir o adoptar soluciones de IA generativa.

¿En qué se diferencia del OWASP Top 10 tradicional?

El OWASP Top 10 tradicional cubre vulnerabilidades de aplicaciones web (inyección SQL, XSS, control de acceso roto). El OWASP LLM Top 10 cubre riesgos específicos de los modelos de lenguaje: prompt injection, fuga de información sensible, agencia excesiva, alucinaciones. Son complementarios: una app con IA necesita defenderse de ambos.

¿Cuál es el riesgo más importante de la lista?

Prompt injection (LLM01) es consistentemente el riesgo número uno. Consiste en manipular las instrucciones que recibe el modelo para alterar su comportamiento. Es difícil de eliminar por completo porque los LLMs no distinguen de forma confiable entre instrucciones legítimas y maliciosas dentro del texto que procesan.

¿Necesito aplicar el OWASP LLM Top 10 si solo uso ChatGPT en mi empresa?

Sí. Aunque no desarrolles tu propia aplicación de IA, si tus empleados usan ChatGPT, Copilot u otra herramienta, te exponés a varios riesgos de la lista: fuga de información sensible, alucinaciones que llevan a malas decisiones y dependencia de proveedores. Una política de uso y capacitación cubren la mayor parte.

¿Tu empresa está por adoptar IA y querés hacerlo seguro?

Agendá un diagnóstico gratuito de 30 minutos. Evaluamos tus riesgos de seguridad ante IA y te damos un plan concreto.