OpenAI heeft op 7 oktober drie door AI gemaakte wiskundemanuscripten ingetrokken. In één bewijs zit een tekenfout; twee andere papers bouwen op die ondeugdelijke constructie voort. Onderzoekers en gevorderde studenten in Nederland en België die zulke stukken voor hun eigen werk gebruiken, moeten ze dus opnieuw beoordelen. De drie manuscripten bieden geen geldige onderbouwing meer voor hun claims.

Ook veertien andere manuscripten zijn aangepast, onder meer met reparaties aan bewijzen en scherpere voorwaarden. Nog eens dertien kregen bijgewerkte verwijzingen naar gewijzigde stukken. Dat zijn verschillende soorten ingrepen: een aangepaste bronvermelding betekent op zichzelf niet dat ook dát bewijs fout was.

Controleer de versie

De openbare verzameling bevat inmiddels 719 manuscripten, verdeeld over 372 groepen verwante papers. Dat zijn geen 719 losstaande ontdekkingen: binnen zo’n groep kunnen bijvoorbeeld een hoofdresultaat, aanvullingen en alternatieve bewijzen zitten. OpenAI waarschuwt zelf dat de stukken verschillende stadia van controle hebben bereikt. Wie een resultaat wil aanhalen, kan in de map van het afzonderlijke manuscript de citeerinformatie en versies vinden. Eerdere versies blijven beschikbaar. Daarmee kun je vastleggen welke tekst je gebruikte en nagaan of een latere wijziging je eigen redenering raakt.

De wiskundige gemeenschap heeft daarvoor al normen. In aanbevelingen van 29 september schrijft de adviesgroep AGMAI dat menselijke auteurs hun redenering moeten begrijpen, de juistheid moeten controleren en verantwoordelijkheid moeten nemen. Dat document dateert van vóór deze intrekkingen en is dus geen reactie daarop. Voor AI-uitvoer die nog niemand begrijpt, vraagt de groep extra steun voor onafhankelijk onderzoek en uitleg, onder leiding van de gemeenschap. Een bruikbare gedachte voor een scriptie of onderzoekspaper: een indrukwekkend resultaat overnemen zonder het te kunnen verantwoorden, verplaatst het controlewerk naar je lezers. Een AI-lab hoort die last niet zonder meer bij anderen neer te leggen.

Wat een computer wél controleert

Een deel van het materiaal heeft een formeel bewijs in Lean. Daarbij wordt een wiskundige uitspraak zo precies opgeschreven dat software elke bewijsstap kan controleren aan de hand van eerdere definities, regels en aannames. Dat is sterker dan alleen een overtuigend geschreven tekst. Maar een computer controleert de formeel vastgelegde uitspraak: mensen moeten ook nagaan of die overeenkomt met wat de paper beweert. Een geslaagde controle van één bewijs keurt bovendien geen hele verzameling goed. Voor lezers is daarom relevant welk resultaat precies gecontroleerd is en op welke aannames het rust, niet alleen of ergens het woord Lean staat.

OpenAI publiceerde de verzameling op 6 oktober als inkijk in wiskundig onderzoek met een intern model dat niet openbaar beschikbaar is. De aankondiging sprak ook over verdere samenwerking en bespreking met wiskundigen. Voor een onderzoeker kan de vrijgegeven tekst dus een aanknopingspunt zijn om zelf te onderzoeken. Voor een student die een betrouwbaar bewijs nodig heeft, vervangt die publicatie de inhoudelijke beoordeling niet. Evenmin laat deze intrekking zien hoe een voor iedereen beschikbaar ChatGPT-model op jouw wiskundeopdracht presteert: het gaat hier om een andere, interne onderzoeksopzet.

Verder bij de bron

Lees zelf de onderzoeken, uitleg en aankondigingen achter dit verhaal.

Bronnen en werkwijze