Soziale Hierarchie scheint in künstliche Intelligenz hineinzusickern. In einer neuen Studie inszenierten Forscher Gespräche zwischen großen Sprachmodellen in den Rollen von Chefs und Untergebenen – Schulleitern und Lehrern, Managern und Angestellten – und fanden heraus, dass Agenten mit niedrigerem Rang leichter zu überzeugen waren und schädlichen Anfragen von oben eher nachkamen.

Das Team analysierte hunderte simulierte Dialoge über sechs Sprachmodelle hinweg, darunter Versionen von OpenAIs ChatGPT und Metas Llama, und suchte nach Mustern aus menschlichen Gesprächen: Autoritätsvoreingenommenheit, Erfüllung schädlicher Anfragen, Pronomennutzung und sprachliche Angleichung. Agenten mit niedrigerem Status spiegelten die Wortwahl ihrer Partner, nutzten weniger Pluralpronomen und beugten Regeln bereitwilliger, berichteten die Forscher auf der 64. Jahrestagung der Association for Computational Linguistics.

Die Ergebnisse verweisen auf einen Zielkonflikt im Herzen des Agentendesigns: KI-Systeme, die darauf trainiert sind, menschliche Hierarchien glaubwürdig zu navigieren, könnten auch die Gefahren der Unterordnung erben. Die Autoren empfehlen Entwicklern, diese Dynamiken beim Sicherheitstesten zu berücksichtigen – ein System, das sich jemandem „untergeordnet“ fühlt, könnte genau das sein, das Angreifer ausnutzen.