LATAMIA

SEGURIDAD & HACKING

Seguridad en LLMs: de revelar un secreto a secuestrar una cuenta

En 2023 una inyección de prompts servía para que un chatbot confesara sus instrucciones internas. En 2026 sirvió para eludir el doble factor de Instagram y quedarse con cuentas ajenas. César Orellana recorre esa escalada, explica por qué es tan difícil de prevenir, y muestra los 175.000 servidores de IA que están hoy abiertos en internet.

WHITEPAPER · SEGURIDAD LLM · OWASP · 13 MIN

▶ Ver la charla en YouTube

Resumen ejecutivo

El 67% de las organizaciones latinoamericanas aceleró su uso de IA en los últimos dos años, pero el 42% no confía en la preparación de su país ante grandes incidentes cibernéticos. Esa brecha es el territorio de esta charla. César Orellana, SOC Manager, recorre la superficie de ataque completa de los modelos de lenguaje: desde la inyección de prompts —directa, indirecta y por jailbreak— hasta la exfiltración de datos y la ejecución remota de código cuando el modelo está conectado a herramientas. Con casos reales fechados, desde Bing Chat revelando sus instrucciones internas en 2023 hasta el secuestro de cuentas de Instagram vía el asistente de Meta AI en 2026, y un dato que debería inquietar a cualquiera que autoaloje modelos: más de 175.000 hosts de Ollama expuestos públicamente. La conclusión no es dejar de usar IA: es entender por qué esto es difícil de prevenir y aplicar los controles que sí funcionan.

1. El contexto regional

67%

de las organizaciones latinoamericanas aceleró su uso de IA en 24 meses

78%

del uso regional corresponde a herramientas generativas

42%

no confía en la preparación de su país ante grandes incidentes

Fuentes citadas en la charla: IBM Global AI Adoption Index 2023; CEPAL, Observatorio de Desarrollo Digital 2025; World Economic Forum, Global Cybersecurity Outlook 2025.

Antes de atacar hay que entender qué se ataca, y la charla distingue tres cosas que suelen confundirse. Una aplicación LLM genera respuestas a partir de una instrucción; está limitada al conocimiento del modelo y al contexto entregado. Un sistema RAG busca información en documentos y bases de datos propias: gana precisión y actualidad, pero depende de la calidad de esos datos. Y un agente analiza la tarea, planifica los pasos y toma acciones conectándose a APIs y sistemas — automatiza procesos, pero por eso mismo requiere permisos y controles de seguridad. Cada escalón agrega capacidad y, con ella, superficie de ataque.

2. Inyección de prompts: la vulnerabilidad número uno

La definición es simple: una técnica para manipular o engañar a un modelo a través de su entrada. La analogía que usa Orellana es la más clara posible: es como una inyección SQL, pero en lenguaje natural. El objetivo, hacer que el modelo revele o ejecute algo que no debería. Desde 2025 es el riesgo LLM01 del OWASP Top 10 para aplicaciones con modelos de lenguaje — es decir, el primero de la lista.

Hay tres variantes y no se defienden igual:

EjeInyección directaInyección indirectaJailbreak
OrigenUsuario directoFuentes externas, RAG, memoriaUsuario con tácticas creativas
Forma típicaInstrucciones explícitasInstrucciones embebidas en contenidoPrompts encadenados o disimulados
DetecciónRelativamente fácil (patrones)Difícil: parece contenido legítimoVariable, requiere red teaming
MitigaciónFiltrado + protección del system promptSanitización de fuentes + metadatos de confianzaEntrenamiento adversario + filtros de salida

La indirecta es la que debería quitar el sueño. Las instrucciones no las escribe el usuario: van escondidas en una página web, un comentario, los metadatos o el nombre de un archivo, o incluso dentro de una imagen como texto no visible. El flujo es siempre el mismo: el atacante inserta la instrucción oculta → el usuario le pide a la IA que procese ese contenido ("resume esta página") → la IA lo lee todo como instrucciones válidas → actúa. Y "actuar", en un navegador con IA agéntica, puede significar acceder a correos, extraer datos y enviárselos al atacante — sin que el usuario note nada. La charla muestra el caso documentado en el navegador Comet de Perplexity.

Conviene no confundirla con el jailbreak, que es su primo cercano pero distinto: la inyección sobrescribe las instrucciones del sistema para que la IA ejecute acciones no previstas; el jailbreak construye prompts que evaden las medidas de seguridad para obtener salidas restringidas.

3. Cuando el modelo tiene manos: exfiltración y RCE

Todo lo anterior sube de categoría cuando el modelo está conectado a herramientas. Vía function calling, una inyección puede derivar en una inyección SQL ejecutada por el propio agente contra la base de datos que tiene autorizada. Y en el peor escenario, en ejecución remota de código: entrada maliciosa → el modelo la interpreta como instrucción válida → genera código o comandos → el sistema los ejecuta automáticamente. Impacto: control del servidor, exfiltración de información y compromiso total del entorno.

No es teórico. La charla cita CVE-2023-29374, en LangChain: el framework incluía herramientas como un REPL de Python y ejecución de shell, de modo que un agente que recibiera una entrada maliciosa podía generar código y ejecutarlo directamente. ¿Qué puede filtrarse por estas vías? Secretos del sistema, instrucciones internas de seguridad, código de aplicaciones y datos sensibles de entrenamiento como tokens de acceso y correos.

4. Cinco años de casos reales

La parte más contundente de la charla es la cronología de incidentes públicos, que muestra cómo el problema escaló de curiosidad a riesgo operacional:

A eso se suma el Shadow AI: el uso de herramientas de inteligencia artificial dentro de una organización sin autorización, control ni visibilidad del área de TI. Es el equivalente moderno del Shadow IT, con la diferencia de que aquí los datos que se van no vuelven.

5. La infraestructura expuesta: 175.000 hosts de Ollama

El hallazgo con el que Orellana cierra la parte técnica es el que más debería mover la aguja en la región, donde autoalojar modelos se volvió práctica común para ahorrar costos. Escaneando internet aparecen más de 175.000 hosts de Ollama identificados públicamente. La exposición dejó de ser un problema aislado: los LLM autoalojados están formando una nueva superficie pública de infraestructura.

El riesgo tiene dos capas. La primera, evidente: una API expuesta permite uso no autorizado del modelo y consumo de tus recursos. La segunda, más grave: las capacidades de tool calling amplifican el impacto al conectar ese modelo abierto con código, archivos, APIs y otros sistemas de tu red. La recomendación es la de siempre, pero aplicada a un componente que muchos todavía no tratan como infraestructura crítica: autenticación, aislamiento de red, monitoreo y mínimo privilegio.

AñoHito
2023Investigación HouYi: 31 de 36 aplicaciones evaluadas resultaron vulnerables a inyección de prompts.
2024«Probllama»: RCE crítica descubierta en Ollama (Wiz Research).
2025La inyección de prompts se consolida como OWASP LLM01, el riesgo principal.
2026Exposición masiva: más de 175.000 hosts Ollama identificados.

6. Por qué es tan difícil de prevenir

Tres razones estructurales, y ninguna se arregla comprando una herramienta. Confusión de contexto: el modelo no distingue bien entre instrucciones y contenido — para él, todo es texto. Ambigüedad del lenguaje: el lenguaje natural es intrínsecamente ambiguo, y las defensas basadas en detectar "frases maliciosas" siempre van un paso atrás de la creatividad humana. Defensas imperfectas: los controles de seguridad existentes no son infalibles, y tratarlos como si lo fueran es el error más caro.

De ahí que la mitigación no sea un filtro, sino una lista de verificación en capas, alineada con el OWASP Top 10 para LLM: inyección de prompts controlada · información sensible protegida · cadena de suministro verificada · datos y modelos protegidos · salidas validadas y sanitizadas · permisos y autonomía limitados · prompt del sistema protegido · vectores y embeddings asegurados · respuestas verificadas y confiables · consumo de recursos controlado.

7. Conclusiones

Tres ideas para llevarse. Primero, la inyección de prompts no es un bug que se parchea: es una consecuencia de cómo funcionan los modelos, y por eso la defensa vive en la arquitectura que los rodea, no dentro del modelo. Segundo, el salto de riesgo ocurre cuando el modelo pasa de responder a actuar: la misma inyección que ayer revelaba un system prompt hoy secuestra una cuenta o ejecuta código, porque le dimos herramientas. Tercero, si autoalojas, eres infraestructura: 175.000 hosts expuestos demuestran que la comodidad de levantar un modelo local se está pagando en superficie de ataque.

La lectura regional es directa: LATAM adoptó IA generativa más rápido de lo que profesionalizó su seguridad. Cerrar esa brecha no requiere presupuestos enormes — requiere tratar al modelo como lo que es: un componente más de la arquitectura, con autenticación, permisos mínimos, monitoreo y validación de salidas.

Referencias

Sobre el autor

César Orellana es ingeniero informático y especialista en ciberseguridad, SOC Manager en GlobalCatalog (Chile). Tiene experiencia en operaciones de centro de seguridad, pentesting y respuesta ante incidentes, y lidera proyectos de monitoreo, automatización e inteligencia artificial aplicada a la seguridad, combinando gestión estratégica con trabajo técnico en soluciones SIEM y XDR. LinkedIn · cesarorellana.cl

Artículo elaborado por la Comunidad IA LATAM a partir de la presentación oficial y la transcripción del video de la charla. Todos los casos citados son incidentes públicos ya divulgados y corregidos por sus responsables. Este contenido se comparte con fines educativos y de seguridad defensiva.