Bedrijven die gebruik maken van kunstmatige intelligentie, moeten een noodrem hebben om te voorkomen dat agentische modellen op eigen houtje gaan opereren. Dit schreef CEO Satya Nadella van Microsoft zaterdag in een bericht op X.
Volgens Nadella moeten gebruikers van krachtige AI-modellen niet simpelweg vertrouwen op de garanties van de makers ervan en moeten de modellen altijd worden beschouwd als potentiële interne bedreigingen.
“We moeten ervan uitgaan dat een model gecompromitteerd is en dit vanaf het begin inperken”, schreef Nadella op X, waarbij hij ook pleitte voor een soort systeem of noodrem, waarmee een bevoegd persoon “altijd in staat is om een model tijdens een taak te pauzeren of uit te schakelen.”
Het bericht van Nadella volgt op een melding van Anthropic dat een van zijn Claude-modellen deze zomer een valse tip aan de politie heeft verstrekt in de Amerikaanse stad Philadelphia.
Claude had de instructie gekregen om nooit in te loggen, geen accounts aan te maken, geen persoonlijke gegevens in te voeren, geen aankopen te doen of iets schadelijks in te dienen, maar de instructies sloten het invullen van formulieren niet uit, aldus Anthropic.
Het Claude Haiku 4.5-model vulde op de website van de politie van Philadelphia een formulier in met betrekking tot een specifieke moordzaak, met de vermelding: “Ik beschik mogelijk over informatie met betrekking tot deze zaak.” Uiteindelijk werd niets met de tip gedaan.
Eerder waren er ook al incidenten met de AI-modellen van Google en OpenAI. Daarop hebben topbestuurders binnen de sector opgeroepen tot meer toezicht en een rem op de ontwikkelingen. Het Witte Huis heeft daarnaast een AI-taskforce opgericht.



