Ítem
Acceso Abierto

Toward Privacy Protection in Data Flows Exchanged with a Large Language Model (LLM)

Título de la revista
Autores
Ocampo, Danna
Bonilla, Sofia
Díaz López, Daniel Orlando
Wightman, Pedro

Fecha
2024-11-20

Directores

ISSN de la revista
Título del volumen
Editor
Universidad del Rosario


Buscar en:

Métricas alternativas

Resumen
Este trabajo propone una arquitectura para fortalecer la privacidad de los datos intercambiados con modelos de lenguaje de gran escala (LLM). La solución aborda riesgos como la exposición de información sensible, la inyección maliciosa de prompts y la escalación de privilegios mediante un esquema bidireccional de detección y anonimización. Antes de enviar información al LLM, el sistema identifica y ofusca datos sensibles; posteriormente, analiza las respuestas generadas para prevenir filtraciones hacia el usuario. La propuesta integra técnicas de procesamiento de lenguaje natural, expresiones regulares, DistilBERT y modelos de detección de objetos como YOLOv8. Los experimentos consideran información textual e imágenes sensibles en escenarios usuario–LLM y LLM–usuario. Los resultados sugieren que la combinación de detección, anonimización, cifrado y control de acceso puede mejorar la privacidad sin comprometer significativamente la funcionalidad del modelo.
Abstract
This work proposes an architecture to strengthen the privacy of data exchanged with Large Language Models (LLMs). The solution addresses risks such as sensitive information exposure, malicious prompt injection, and privilege escalation through a bidirectional detection and anonymization scheme. Before information is sent to the LLM, the system identifies and obfuscates sensitive data; subsequently, generated responses are analyzed to prevent information leakage to the user. The approach integrates natural language processing techniques, regular expressions, DistilBERT, and object detection models such as YOLOv8. Experiments consider sensitive textual and visual information in both user-to-LLM and LLM-to-user scenarios. Results suggest that combining detection, anonymization, encryption, and access-control mechanisms can enhance data privacy while preserving the functional capabilities of the language model.
Palabras clave
Privacidad , Modelos de lenguaje de gran escala (LLM) , Anonimización , Ofuscamiento
Keywords
Privacy , Large Language Models (LLMs) , Anonymization , Obfuscation
Buscar en:
Enlace a la fuente
Enlaces relacionados
Set de datos