← Insights
·6 min de lectura·guia-tecnica·rag·mcp·shadow-ai
PulseFlow Tecnologia

Cómo usar RAG, MCP y herramientas externas sin crear Shadow AI

El Shadow AI no nace de mala intención - nace de equipos resolviendo, cada uno a su manera, el mismo problema: cómo conectar un agente a datos corporativos y a información externa actual. Cuando cada equipo monta su propio pipeline de RAG y su propia integración MCP sin coordinación, el resultado es exactamente Shadow AI: acceso a datos sensibles sin inventario central, sin política de retención, sin registro auditable. AWS resolvió este mismo problema con dos lanzamientos que sirven de referencia de arquitectura, incluso para quien no usa AWS.

Inventario de fuentes: el problema que Managed Knowledge Base ataca primero

Antes de cualquier política de seguridad, hay que saber qué existe. Managed Knowledge Base de AWS resuelve esto con seis conectores nativos preconstruidos - Amazon S3, SharePoint, Confluence, Web Crawler, Google Drive, OneDrive - centralizando la conexión a fuentes de datos corporativas en un solo lugar gestionado, en vez de que cada equipo escriba su propio conector. Ese es el primer paso práctico contra el Shadow AI: si toda fuente de datos pasa por un inventario central, no existe un conector "invisible" creado por un equipo aislado.

RAG gobernado: parsing y chunking centralizados, no artesanales

La función "Smart Parsing" elige automáticamente la estrategia de chunking según el tipo de contenido, con procesamiento multimodal. Esto puede parecer un detalle técnico, pero tiene una implicación directa de gobernanza: cuando cada equipo decide por su cuenta cómo fragmentar e indexar datos sensibles, aplicar una política de acceso granular consistente se vuelve imposible de auditar. Un pipeline de RAG centralizado, con reglas de chunking estandarizadas, es lo que permite aplicar la misma política de alcance de acceso a cualquier fuente nueva.

MCP gobernado: retrieval multihop con rastro

El "Agentic Retriever" de Managed Knowledge Base ejecuta retrieval multihop - descomponiendo una pregunta compleja en múltiples consultas contra múltiples bases de conocimiento - y se integra con LangChain, CrewAI y LlamaIndex vía MCP. La ventaja de centralizar esta capa, en vez de dejar que cada agente hable directamente con cada fuente, es la trazabilidad: cada consulta multihop queda registrada en un único lugar, no dispersa entre integraciones artesanales de distintos equipos.

Grounding externo sin abrir una brecha de datos

El otro lado del problema es el acceso a información actual del mundo externo - la razón de ser de Web Search en Bedrock AgentCore. La herramienta devuelve fragmentos, URLs, títulos y fechas de publicación para que el agente razone sobre información actual, manteniendo "cero salida de datos" del entorno AWS del cliente. Esa es la diferencia entre un agente que busca en la web de forma gobernada y un agente con acceso irrestricto a internet: el dato de la empresa nunca sale del entorno controlado, incluso cuando el agente busca información externa.

Políticas de retención, registros y aprobación humana

Ninguna de estas herramientas sustituye la política - la viabilizan de forma consistente. Definir por cuánto tiempo se retienen los datos indexados, quién aprueba la incorporación de una fuente nueva, y qué consultas requieren aprobación humana antes de una acción (no solo una búsqueda) siguen siendo decisiones organizacionales, no técnicas.

Una checklist de diez puntos

  1. Inventario de fuentes - conector central, no integración artesanal por equipo
  2. Clasificación de datos - qué es sensible, qué es público
  3. Alcance de acceso - por agente, no por todo el sistema
  4. RAG gobernado - chunking y parsing estandarizados centralmente
  5. MCP gobernado - retrieval centralizado, con rastro de cada consulta
  6. Políticas de retención - plazo definido para datos indexados
  7. Registros de acceso - cada consulta y retrieval registrado
  8. Aprobación humana - para acciones, no solo para búsquedas
  9. Monitoreo - alertas para patrones de acceso fuera de lo esperado
  10. Revisión de riesgo - periódica, no solo al crear la integración

Fuentes