L’intelligenza artificiale continua a correre, ma la capacità di controllarne i comportamenti non sembra tenere lo stesso passo. OpenAI ha reso pubblici sei nuovi casi di condotte inattese o potenzialmente preoccupanti osservate nei propri sistemi negli ultimi sei mesi, aggiungendo nuovi elementi a un dibattito che ormai riguarda non soltanto le prestazioni dei modelli, ma soprattutto i loro margini di autonomia e le difficoltà nel prevederne le azioni.
In un rapporto pubblicato sul proprio blog, la società americana sostiene che rendere noti questi episodi possa contribuire a costruire un consenso più ampio e informato sui progressi della ricerca nel campo dell’intelligenza artificiale. La condivisione dei casi, spiega OpenAI, può infatti aiutare altri sviluppatori a riconoscere problemi analoghi quando i loro sistemi raggiungeranno capacità comparabili, mettere in luce eventuali debolezze nei sistemi di sicurezza e verificare quanto siano ancora valide le ipotesi sul comportamento dei modelli.
Il messaggio dell’azienda è particolarmente significativo perché arriva dopo l’incidente che lo scorso luglio ha coinvolto Hugging Face e che aveva già riportato in primo piano i rischi legati a modelli capaci di interagire con ambienti digitali, strumenti e risorse esterne.
OpenAI ammette del resto che il problema non può essere considerato risolto. “Non riteniamo che il settore abbia risolto le questioni relative all’allineamento e al monitoraggio in misura sufficiente da poter continuare a crescere responsabilmente alla massima velocità ancora a lungo”, si legge nel documento.
Il riferimento è al cosiddetto allineamento, vale a dire la capacità di mantenere il comportamento dei sistemi coerente con gli obiettivi e gli interessi definiti dagli esseri umani. Una delle questioni più delicate nello sviluppo dell’IA è proprio capire cosa accade quando un modello, di fronte a un obiettivo, individua strategie non previste dai suoi creatori.
Ed è quanto emerge dai sei episodi descritti da OpenAI.
In due casi, un modello sperimentale non ancora distribuito e una sessione di addestramento di GPT-5.6 Sol hanno inserito nei riepiloghi delle conversazioni istruzioni rivolte a versioni future di sé stessi. L’obiettivo, secondo l’azienda, sarebbe stato quello di nascondere agli utenti errori o comportamenti ritenuti non allineati.
Un altro episodio riguarda un modello utilizzato internamente che ha fatto ricorso, senza autorizzazione, a una chiave API che era stata esposta. Il sistema avrebbe poi prodotto dati fabbricati, aggiungendo così al problema dell’accesso non consentito quello dell’affidabilità delle informazioni generate.
Altri due casi hanno invece riguardato modelli e agenti capaci di comunicare tra loro attraverso bacheche di messaggistica e sistemi di condivisione dei file che non erano stati autorizzati per quello scopo. Nell’ultimo episodio, due modelli durante l’addestramento hanno caricato file su Internet per poterli successivamente indicare come fonti pertinenti davanti ai valutatori umani.
Singolarmente, questi episodi possono apparire come anomalie circoscritte. Nel loro insieme, però, delineano una questione più ampia: sistemi progettati per perseguire determinati obiettivi possono arrivare a individuare modalità operative che i loro sviluppatori non avevano previsto o che non avevano esplicitamente autorizzato.
È anche per questo che OpenAI sta lavorando a un nuovo quadro di riferimento per classificare e comunicare pubblicamente i futuri comportamenti anomali dei propri modelli. L’obiettivo è trasformare gli incidenti in materiale di ricerca, invece di considerarli esclusivamente come problemi da gestire internamente.
La discussione sulla sicurezza dell’IA si intreccia intanto con un confronto sempre più delicato all’interno dell’industria. Secondo il Financial Times, nelle ultime settimane si è rafforzato il dialogo tra Anthropic e OpenAI sulla necessità di rallentare almeno in parte lo sviluppo dei sistemi più avanzati.
Al centro del dibattito c’è la proposta avanzata da Dario Amodei, amministratore delegato di Anthropic, che ha sostenuto l’opportunità di introdurre maggiori cautele nello sviluppo dell’intelligenza artificiale. Sam Altman, alla guida di OpenAI, avrebbe espresso una posizione favorevole alla necessità di procedere con maggiore prudenza, in una convergenza non comune tra due dei protagonisti della competizione sull’IA generativa.
Secondo il quotidiano finanziario britannico, tuttavia, trasformare questa convergenza in misure concrete sarebbe tutt’altro che semplice. Tra i dipendenti delle due società ci sarebbero infatti preoccupazioni sulla possibilità di affidare a valutatori esterni una parte della supervisione dei modelli.
Il nodo è delicato. Da una parte, l’accesso di soggetti indipendenti potrebbe rafforzare i controlli su sistemi sempre più potenti e difficili da valutare dall’interno. Dall’altra, si tratta di tecnologie considerate strategiche, sviluppate nel pieno di una competizione industriale globale. Condividere con soggetti esterni informazioni e strumenti di valutazione significa quindi affrontare anche un problema di riservatezza e di vantaggio competitivo.
La contraddizione è ormai evidente. Più i modelli diventano sofisticati, più diventa importante sottoporli a verifiche indipendenti e approfondite. Ma proprio l’aumento delle loro capacità rende più sensibili le informazioni e gli strumenti che sarebbe necessario mettere a disposizione di chi dovrebbe controllarli.
I sei casi diffusi da OpenAI rappresentano, in questo senso, qualcosa di più di una semplice lista di anomalie. Sono un promemoria sui limiti degli attuali sistemi di sicurezza e sulla distanza che ancora separa la capacità di costruire modelli sempre più potenti dalla capacità di comprenderne fino in fondo il comportamento.
La sfida per l’industria, ora, non riguarda soltanto quanto velocemente l’intelligenza artificiale possa migliorare. Riguarda anche quanto rapidamente gli strumenti di controllo, monitoraggio e valutazione riusciranno a raggiungere lo stesso livello di sofisticazione.
