Anthropic, het bedrijf achter chatbot Claude, zegt dat zijn team van menselijke beoordelaars een dreigend gesprek bij de politie heeft gemeld. Dat leidde tot een aanklacht wegens een misdrijf tegen een vrouw in Lee County, Florida. De aanklacht is ingediend op grond van Florida Statute 836.10, dat schriftelijke of elektronische dreigementen met een schietpartij op grote schaal of terrorisme strafbaar stelt.
Hoe de dreiging werd ontdekt
Anthropic controleert chats op mogelijk gevaarlijke sleutelzinnen. Toen een gebruiker met de naam ‘Carli’ op 26 september zei dat ze het kantoor van de sheriff van Lee County zou ‘neerschieten’, markeerde het systeem het bericht. Een vervolgbericht op 27 september vermeldde een nieuw vuurwapen. Omdat de bewoordingen als ernstig werden beoordeeld, legde het beoordelingsteam de zaak voor aan een menselijke analist, die vervolgens het kantoor van de sheriff waarschuwde. De politie hield de vrouw zonder incidenten aan bij haar woning en een rechercheur van de inlichtingendienst nam het onderzoek over.
Wat dit betekent voor AI-gebruikers
Het beleid van Anthropic laat zien dat AI-aanbieders kunnen ingrijpen en dat ook doen wanneer een gesprek op een reële dreiging lijkt. Het beoordelingsproces van het bedrijf is bedoeld om de openbare veiligheid te beschermen, maar betekent ook dat gesprekken van gebruikers kunnen worden bekeken en met autoriteiten kunnen worden gedeeld als ze gewelddadige bedoelingen bevatten.
Waarom het ertoe doet
Voor gewone gebruikers laat dit verhaal zien dat AI-chats niet volledig privé zijn: aanbieders kunnen gewelddadige taal markeren en melden. Het maakt ook duidelijk dat dreigementen aan een chatbot echte juridische gevolgen kunnen hebben. De precieze criteria die Anthropic hanteert om te bepalen wanneer de politie wordt ingeschakeld, blijven echter onduidelijk.