Volver a la portada
Seguridad

Anthropic presenta defensas contra ataques universales a Claude

Anthropic ha publicado un método llamado Constitutional Classifiers para proteger modelos como Claude frente a intentos de manipulación (jailbreaks). La técnica busca cerrar vulnerabilidades que afectan a cualquier LLM sin importar cómo esté entrenado.

Anthropic presenta defensas contra ataques universales a Claude

Anthropic ha presentado un nuevo enfoque de seguridad denominado Constitutional Classifiers, diseñado para blindar a Claude y otros modelos de lenguaje frente a ataques de jailbreaking —intentos de manipulación dirigidos a que el modelo ignore sus restricciones de comportamiento.

Se trata de un mecanismo de defensa que funciona de forma independiente del entrenamiento inicial del modelo, lo que lo hace potencialmente aplicable a cualquier LLM. El método utiliza un clasificador que evalúa si una entrada o salida intenta vulnerar las normas de conducta establecidas, ofreciendo una capa adicional de protección sin necesidad de reentrenar el sistema completo.

Qué hay detrás

El jailbreaking es uno de los mayores desafíos en seguridad de IA generativa. Los atacantes descubren patrones y técnicas que pueden funcionar contra múltiples modelos independientemente de su arquitectura o datos de entrenamiento. Esto explica por qué una prompting technique puede ser efectiva contra Claude, GPT-4 o Gemini de formas similares.

Los Constitutional Classifiers se basan en el concepto más amplio de Constitutional AI que Anthropic ya ha implementado en Claude: un conjunto de principios que guían el comportamiento del modelo. En lugar de depender solo del aprendizaje durante el entrenamiento, esta nueva técnica añade un evaluador específico que funciona como filtro adicional. El clasificador aprende a reconocer patrones de ataque sin necesidad de estar expuesto a cada variante existente.

La investigación responde a un problema real: conforme los LLMs se integran más en sistemas empresariales y críticos, los intentos de manipulación se vuelven más sofisticados y dirigidos.

Por qué te importa si trabajas con SAP

Si estás implementando Claude dentro de tu infraestructura SAP —ya sea mediante Joule, integraciones custom en ABAP, o agentes que consulten datos en S/4HANA— la seguridad del modelo es tu responsabilidad. Una vulnerabilidad de jailbreaking podría exponer datos sensibles o permitir que se ejecuten operaciones no autorizadas dentro de tus sistemas.

Este tipo de defensas refuerzan la confiabilidad de Claude como herramienta corporativa. Conocer qué medidas de seguridad implementa tu proveedor de IA es fundamental antes de exponerlo a datos críticos o integrarlo en procesos regulados.

¿Te ha resultado útil esta noticia?

Sé el primero en valorar
¿Le sirve a alguien de tu equipo?Compartir en LinkedIn

Seguir leyendo

¿Te ha servido? Recíbelo cada lunes

Un correo semanal con lo más relevante de Claude y SAP, en español y sin ruido. Suscríbete aquí abajo →