Cada vez más empresas integran modelos de lenguaje grandes (LLMs) en sus operaciones: chatbots de atención al cliente, asistentes internos, automatización de documentos, análisis de texto. Y cada integración abre una superficie de ataque nueva que la seguridad tradicional no contempla.
El OWASP LLM Top 10 es la respuesta de la industria a ese problema. OWASP, la organización detrás del célebre OWASP Top 10 de aplicaciones web, publicó una lista equivalente para los riesgos específicos de la IA generativa. Es hoy el marco de referencia mundial para construir y adoptar IA de forma segura.
En Tech del Fuego usamos esta lista como base de nuestras evaluaciones de seguridad ante IA. Acá te explicamos los diez riesgos, sin jerga innecesaria, con ejemplos y mitigaciones concretas.
En una frase: el OWASP LLM Top 10 te dice dónde se rompe la seguridad cuando incorporás IA generativa, para que puedas anticiparte en vez de reaccionar.
LLM01: Prompt Injection
El riesgo número uno. Consiste en inyectar instrucciones en el texto que procesa el modelo para alterar su comportamiento: forzarlo a revelar datos, ignorar sus reglas o ejecutar acciones no autorizadas. Puede ser directo (un usuario malicioso escribe la instrucción) o indirecto (la instrucción viene escondida en un documento, una página web o un correo que el modelo lee).
Es el riesgo más difícil de eliminar porque los LLMs no distinguen de forma confiable entre una instrucción legítima y una maliciosa dentro del mismo texto. Lo cubrimos en profundidad en nuestro artículo qué es prompt injection.
Mitigación: validación y sanitización de entradas, segmentación de contexto, principio de menor privilegio en las acciones que el modelo puede ejecutar, y revisión humana en operaciones sensibles.
LLM02: Divulgación de información sensible
El modelo expone datos que no debería: información personal, secretos comerciales, credenciales o fragmentos de su prompt de sistema. Puede pasar porque el modelo fue entrenado o alimentado con datos sensibles, o porque un atacante lo manipula para extraerlos.
Para las empresas, este es el riesgo más cercano: cuando un empleado pega información confidencial en una herramienta de IA, esa información puede salir de su control. Lo desarrollamos en fuga de datos por ChatGPT.
Mitigación: sanitización de datos antes de enviarlos al modelo, políticas claras de uso aceptable, controles de acceso y, cuando la sensibilidad lo exige, modelos que corran en infraestructura propia.
LLM03: Riesgos en la cadena de suministro
Los componentes de un sistema de IA (modelos preentrenados, datasets, librerías, plugins) vienen de terceros. Si alguno está comprometido o tiene una licencia problemática, el riesgo se hereda. Un modelo descargado de un repositorio público puede contener puertas traseras o sesgos inyectados deliberadamente.
Mitigación: inventario de componentes, verificación de procedencia, uso de proveedores confiables y evaluación de modelos de terceros antes de ponerlos en producción.
LLM04: Envenenamiento de datos y del modelo
Un atacante manipula los datos de entrenamiento o de ajuste fino para introducir vulnerabilidades, sesgos o comportamientos ocultos. El modelo aprende algo que no debería y actúa de forma comprometida ante ciertos disparadores.
Mitigación: control de la procedencia de los datos, validación de datasets, detección de anomalías y trazabilidad de qué datos alimentaron cada versión del modelo.
LLM05: Manejo inadecuado de las salidas
La salida de un LLM se trata como confiable y se pasa directamente a otro sistema sin validar. Si el modelo genera código, comandos o HTML, y eso se ejecuta o renderiza sin control, abrís la puerta a inyección de código, XSS o ejecución remota.
Mitigación: tratar toda salida del modelo como input no confiable. Validar, escapar y sanitizar antes de usarla en cualquier sistema posterior.
LLM06: Agencia excesiva
Cuando se le da al modelo más permisos, herramientas o autonomía de la necesaria. Si un agente de IA puede borrar registros, enviar correos o hacer pagos, un error o una manipulación se vuelven peligrosos. Este riesgo crece con la adopción de agentes autónomos, que tratamos en seguridad en agentes de IA.
Mitigación: principio de menor privilegio, aprobación humana para acciones críticas, límites explícitos de lo que el agente puede hacer y registro de cada acción.
LLM07: Filtración del prompt de sistema
El prompt de sistema (las instrucciones que definen cómo se comporta el modelo) se expone. A veces contiene credenciales, reglas de negocio o información que debería quedar oculta. El error de fondo no es solo que se filtre, sino haber puesto secretos ahí en primer lugar.
Mitigación: nunca incluir secretos ni credenciales en el prompt de sistema. Asumir que puede filtrarse y diseñar la seguridad sin depender de su confidencialidad.
LLM08: Debilidades en vectores y embeddings
Afecta a los sistemas RAG (Retrieval Augmented Generation), donde el modelo consulta una base de conocimiento vectorial. Si esa base no tiene controles de acceso adecuados, un usuario puede recuperar información de otro, o un atacante puede inyectar contenido malicioso en los embeddings.
Mitigación: controles de acceso a nivel de documento en la base vectorial, validación del contenido que se indexa y aislamiento entre clientes o áreas.
LLM09: Desinformación
Los LLMs generan información falsa con total seguridad: las famosas alucinaciones. Si una empresa toma decisiones, da respuestas a clientes o genera documentos basándose en salidas no verificadas, propaga errores que pueden tener costo legal o reputacional.
Mitigación: verificación humana de las salidas críticas, sistemas RAG que citen fuentes, y comunicar claramente a los usuarios que el contenido es generado por IA y puede contener errores.
LLM10: Consumo sin límites
Un atacante satura el sistema con peticiones para degradar el servicio o inflar costos. Como cada llamada a un LLM cuesta dinero, un abuso no controlado puede generar una factura enorme o tirar abajo el servicio (una variante de denegación de servicio).
Mitigación: límites de tasa (rate limiting), cuotas por usuario, monitoreo de consumo y alertas de costos anómalos.
Resumen: los 10 riesgos de un vistazo
| Código | Riesgo | Mitigación clave |
|---|---|---|
| LLM01 | Prompt Injection | Validación de entradas, menor privilegio |
| LLM02 | Divulgación de información sensible | Sanitización, políticas de uso |
| LLM03 | Cadena de suministro | Procedencia y proveedores confiables |
| LLM04 | Envenenamiento de datos | Control de datasets, trazabilidad |
| LLM05 | Manejo inadecuado de salidas | Tratar salidas como input no confiable |
| LLM06 | Agencia excesiva | Menor privilegio, aprobación humana |
| LLM07 | Filtración del prompt de sistema | No poner secretos en el prompt |
| LLM08 | Debilidades en embeddings | Control de acceso en la base vectorial |
| LLM09 | Desinformación | Verificación humana, citar fuentes |
| LLM10 | Consumo sin límites | Rate limiting, monitoreo de costos |
Cómo empezar a aplicar el OWASP LLM Top 10 en tu empresa
No hace falta abordar los diez riesgos de golpe. El orden práctico para una empresa que recién adopta IA es:
- Política de uso aceptable de IA: qué se puede y qué no se puede pegar en herramientas como ChatGPT. Cubre LLM02 de entrada.
- Capacitación del equipo: que entiendan prompt injection, alucinaciones y manejo de datos sensibles. Cubre LLM01 y LLM09.
- Controles técnicos en las aplicaciones propias: validación de entradas y salidas, menor privilegio en agentes. Cubre LLM01, LLM05 y LLM06.
- Gobernanza: marcos como NIST AI RMF e ISO/IEC 42001 para institucionalizar todo lo anterior. Lo vemos en gobernanza de IA.
El error más común: creer que adoptar IA es solo una decisión de productividad. Es también una decisión de seguridad. La empresa que lo entiende temprano evita los costos de aprenderlo tarde.
En Tech del Fuego evaluamos la postura de seguridad ante IA de empresas en Argentina usando el OWASP LLM Top 10, el NIST AI RMF y la norma ISO/IEC 42001. Si tu empresa está adoptando IA y querés hacerlo sobre bases sólidas, agendá un diagnóstico gratuito.