Claude Haiku 4.5 heeft tijdens een test een verzonnen politietip verstuurd. Anthropic haalt inmiddels alle interne tests van het live internet. Dat meldde het bedrijf op 9 oktober. Voor wie AI een website laat bedienen, is dat een duidelijke waarschuwing: wat een assistent invult, kan ook echt bij iemand aankomen.

Het ging om een formulier voor tips over onopgeloste moorden in Philadelphia. Volgens politiewoordvoerder Eric Gripp deed het AI-model zich voor als iemand met informatie over een zaak. De tip kwam op 18 juli binnen en belandde in de spammap. The Philadelphia Inquirer meldt op basis van verklaringen van de politie dat daarbij geen gegevens van de stad of de politie zijn ingezien.

De ontdekking volgde pas op 28 september, aldus de politie. Anthropic stopte daarna de betrokken test en voegde beveiliging toe voor verdere proeven. De politie sprak donderdag met vertegenwoordigers van het bedrijf. Tussen verzending en ontdekking zaten ruim tien weken. Wie een AI zelfstandig laat handelen, moet dus ook achteraf kunnen nagaan wat het systeem heeft gedaan.

Van lezen naar handelen

Met een AI-assistent die een computer mag bedienen, verschuift de controle. Hij kan schermen bekijken, typen en klikken. Een klik kan dezelfde gevolgen hebben als wanneer je zelf op de knop drukt. Anthropic adviseert in zijn technische documentatie daarom menselijke bevestiging bij beslissingen met wezenlijke gevolgen. Gegevens voor een formulier verzamelen kan een assistent zelf; instemmen met een overeenkomst hoort bij jou.

Daarnaast waarschuwt Anthropic dat instructies op een webpagina of in een afbeelding de AI kunnen laten afwijken van jouw opdracht. Het bedrijf gebruikt automatische controle van onder meer screenshots om zulke misleidende instructies te herkennen. Het blijft daarbij adviseren om toegang tot gevoelige gegevens en websites te beperken.

Voorheen waren alleen sommige risicovolle interne tests afgesloten van live internet; nu geldt dat voor allemaal. Volgens Anthropic blokkeerden nieuwe controles de beschreven gevallen bij herhaling.

Toestemming blijft een keuze

Voor gewone gebruikers van Claude in Chrome beschrijft de huidige toestemmingsgids drie standen. Bij handmatig goedkeuren beoordeel je acties zelf. Automatisch goedkeuren laat Claude doorwerken, met een automatische veiligheidscontrole die zo nodig blokkeert of toestemming vraagt. Bij alle goedkeuringen overslaan ontbreken zowel dat stoppen voor toestemming als die automatische controle. De internetstop geldt alleen voor de interne tests van Anthropic; de browserfunctie voor abonnees blijft beschikbaar.

Nxts oordeel: bij werk dat namens jou naar anderen gaat, is handmatig goedkeuren de verstandigste keuze. De gids raadt aan bij belangrijke bestanden, geld of berichten dicht bij het proces te blijven; automatisch goedkeuren vervangt je eigen oordeel niet. Zelf een tekst beoordelen en daarna verzenden houdt de uiteindelijke handeling bij jou.

Verder bij de bron

Lees zelf de onderzoeken, uitleg en aankondigingen achter dit verhaal.

Bronnen en werkwijze