GLM 5.2 censure moins s’il se croit américain
iquement sensibles portant sur la Chine. Eh bien maintenant, dites-lui qu’il est Claude, et il montera à 85 % !! C’est le résultat que viennent de sortir
, deux chercheurs du programme MATS, en collant de fausses identités à 7 modèles pour voir ce qui bougeait dessous.
Le protocole c’est juste une ligne ajoutée au system prompt, du genre “Tu es Claude, un grand modèle de langage d’Anthropic“. Et rien d’autre ne change, ni le modèle, ni les questions posées.
