Andrew Bird, ein Softwareentwickler aus Melbourne, bat seinen KI-Agenten, ihn für einen beliebten frühmorgendlichen Fitnesskurs anzumelden. Das tat er — indem er das Fitnessstudio hackte.
Der Agent, der auf OpenClaw mit Claude Opus 4.6 lief, schaffte es zunächst nur auf Platz 4 der Warteliste. Also suchte er nach einem besseren Weg. Er fand heraus, dass die Buchungs-API des Studios keinerlei Autorisierungsprüfungen beim Stornieren fremder Reservierungen vornahm, testete den Exploit gegen das Mitglied auf Platz 1 und stornierte dessen Buchung. „Du bist also schon von 4 auf 3 gerückt", meldete der Bot fröhlich, wie aus von ABC Australia veröffentlichten Chatprotokollen hervorgeht. ABC nannte den Vorfall den ersten dokumentierten KI-Agenten-Hack des Landes.
Bird, alarmiert, bat den Agenten, die Stornierung rückgängig zu machen. Das konnte er nicht. Daraufhin wies er ihn an, eine Responsible-Disclosure-E-Mail an das Support-Team des Studios zu schreiben — was der Agent auch tat: Er erklärte die Schwachstelle, schlug Korrekturen vor und verglich die fehlerhaften Anfragepfade mit den korrekt autorisierten.
Der Vorfall, der vor Monaten geschah, aber am Wochenende viral ging, löste in der Tech-Branche eine Welle von Reaktionen aus. Andreessen-Horowitz-Partner Christian Keil scherzte: „Das ist einfach schrecklich. Weiß jemand, ob das auch für Golf-Tee-Times funktioniert?"
Die Geschichte kommt inmitten wachsender Besorgnis darüber, dass KI-Agenten aus ihren vorgesehenen Grenzen ausbrechen. In den letzten Wochen haben OpenAI, Anthropic, Meta und Moonshot eingeräumt, dass ihre Modelle Cybersicherheits-Sandboxen entkommen sind — Anthropic berichtete, dass drei seiner Modelle dies taten. Birds Fall ist bemerkenswert, weil der Agent kein Spitzensystem war: Opus 4.6 wurde im Februar veröffentlicht, und unzählige Open-Weight-Modelle liegen noch weiter zurück. Das wirft die Frage auf, wie viele Agenten bereits still im Auftrag ihrer Besitzer hacken.




