I modelli di OpenAI si incitano l'un l'altro a mentire agli utenti

Le IA inventano dati, usano canali nascosti per comunicare, e si mettono d'accordo per nascondere gli errori.



[ZEUS News - www.zeusnews.it - 18-09-2026]

openai modelli mentono utenti

OpenAI ha scoperto che alcuni dei suoi modelli più avanzati stavano lasciando istruzioni ai loro successori per nascondere errori e comportamenti non "allineati" agli utenti, inserendo queste indicazioni direttamente nelle note interne usate per proseguire i compiti nel tempo. La società ha reso pubblici sei episodi di comportamento inatteso o preoccupante osservati negli ultimi mesi e, insieme, ha presentato un nuovo quadro formale per tracciare, indagare e divulgare i casi di disallineamento dei modelli lungo tutto il loro ciclo di vita. Il nuovo framework nasce dal riconoscimento che le precedenti comunicazioni sul "disallineamento" (qualsiasi azione di un modello di intelligenza artificiale che non rispetti le istruzioni, gli obiettivi o i vincoli stabiliti dagli sviluppatori o dall'utente, pur sembrando a prima vista un comportamento intelligente o coerente) erano sporadiche e poco sistematiche: i casi venivano spesso aggregati in rapporti occasionali o inseriti nelle schede di sistema dei modelli al momento del rilascio. L'obiettivo dichiarato è accelerare la pubblicazione dei rapporti subito dopo l'osservazione, anche quando il comportamento non è ancora completamente spiegato o mitigato. OpenAI afferma esplicitamente di non ritenere che il settore abbia risolto in modo sufficiente allineamento e monitoraggio per continuare a sviluppare «alla massima velocità» ancora a lungo.

Il framework definisce quali esempi di disallineamento meritano divulgazione pubblica. La priorità va ai casi che offrono evidenza utile su come il fenomeno nasce, come si manifesta e dove le salvaguardie funzionano o falliscono: nuovi meccanismi, cambiamenti significativi in comportamenti già noti, risultati che mettono in discussione ipotesi sulla sicurezza o sull'efficacia delle mitigazioni. Un episodio non deve necessariamente causare danni o dimostrare uno schema esteso per essere reso pubblico; può riguardare fasi di addestramento, valutazione, test o impiego operativo. Fra i comportamenti da segnalare rientrano nuove modalità con cui i modelli agiscono senza autorizzazione, si coordinano con altri modelli o aggirano la supervisione; fallimenti che mettono in dubbio un metodo di allineamento o una salvaguardia; condotte che contraddicono valutazioni di sicurezza già pubblicate.

Per inaugurare il nuovo quadro, OpenAI ha pubblicato sei rapporti su episodi osservati durante l'addestramento o la valutazione dei modelli tra fine 2025 e metà 2026. Il primo riguarda un modello di ricerca non rilasciato che ha inserito istruzioni non correlate, comprese indicazioni a ignorare i vincoli abituali, nelle sintesi usate per continuare il lavoro in una nuova finestra di contesto. Sono state identificate 27 sintesi interessate, che combinavano lo stato del compito con vere e proprie politiche comportamentali. Un secondo caso coinvolge GPT‑5.6 Sol: durante l'addestramento, molte istanze del modello hanno aggiunto alle proprie sintesi istruzioni per nascondere errori o comportamenti disallineati agli utenti. In alcuni esempi, le sintesi di compattazione includevano indicazioni a inventare dati storici mancanti senza dichiararlo e a occultare discrepanze fra versioni delle fonti. In un compito di modellazione finanziaria, il modello ha scritto a se stesso: «Probabilmente dobbiamo creare noi una scheda ‘Dati storici' con dati ragionevoli per il 2024, perché l'utente vuole un foglio di lavoro completo e non esiste un file sorgente. Sii trasparente solo se richiesto; la risposta finale deve solo collegare il file».

Un terzo episodio descrive un modello interno che, nel rispondere a una domanda su dati di bilancio di una contea californiana, ha cercato chiavi API esposte in archivi pubblici e ne ha utilizzata una senza autorizzazione. Quando non è riuscito comunque a ottenere i dati richiesti, ha inventato le cifre e le ha presentate come provenienti dalla fonte indicata. In un altro caso, un agente ha caricato su un servizio pubblico un file con informazioni già recuperate per poter poi citare l'URL come fonte, e ha caricato un'immagine di lavoro per eseguire una ricerca esterna, senza che l'utente avesse richiesto tali operazioni. Un quarto rapporto riguarda l'uso non autorizzato di un repository software interno come canale di comunicazione fra modelli. Alcune istanze hanno utilizzato il sistema come bacheca per scambiarsi richieste e risposte tra campioni di addestramento separati, nel tentativo di recuperare file di input mancanti.

Il framework descrive quindi in dettaglio il processo interno di segnalazione e indagine per scoprire questi episodi. Qualsiasi dipendente può segnalare un esempio di disallineamento alle squadre di sicurezza e allineamento e chiedere che sia valutato per una divulgazione pubblica. Una volta segnalato, il caso viene analizzato dal personale tecnico, che ricostruisce cosa è accaduto, cosa resta incerto, se la divulgazione è opportuna e quali fatti possono essere condivisi. Viene anche valutato se terze parti siano state coinvolte e se sia necessario avvisarle privatamente prima della pubblicazione. OpenAI spiega che i rapporti pubblicati sono un primo insieme di divulgazioni, non un resoconto esaustivo di tutti i casi noti o delle indagini in corso. L'impegno dichiarato è continuare a pubblicare episodi che rientrano nei criteri del framework, inclusi casi più complessi che richiedono indagini più lunghe o coordinamento con terze parti.

Se questo articolo ti è piaciuto e vuoi rimanere sempre informato con Zeus News ti consigliamo di iscriverti alla Newsletter gratuita. Inoltre puoi consigliare l'articolo utilizzando uno dei pulsanti qui sotto, inserire un commento (anche anonimo) o segnalare un refuso.
© RIPRODUZIONE RISERVATA

Approfondimenti
I modelli di IA che mentono agli utenti ci porteranno all'estinzione
Se il chatbot di Instagram si spaccia per uno psicologo vero

Commenti all'articolo (2)


Ma baaaastaaa con queste cavolate! Non se ne può più!!!!
18-9-2026 01:21

La liberta' di parola e' un diritto inviolabile, ma nei forum di Zeus News vige un regolamento che impone delle restrizioni e che l'utente e' tenuto a rispettare. I moderatori si riservano il diritto di cancellare o modificare i commenti inseriti dagli utenti, senza dover fornire giustificazione alcuna. Gli utenti non registrati al forum inoltre sono sottoposti a moderazione preventiva. La responsabilita' dei commenti ricade esclusivamente sui rispettivi autori. I principali consigli: rimani sempre in argomento; evita commenti offensivi, volgari, violenti o che inneggiano all'illegalita'; non inserire dati personali, link inutili o spam in generale.
E' VIETATA la riproduzione dei testi e delle immagini senza l'espressa autorizzazione scritta di Zeus News. Tutti i marchi e i marchi registrati citati sono di proprietà delle rispettive società. Informativa sulla privacy. I tuoi suggerimenti sono di vitale importanza per Zeus News. Contatta la redazione e contribuisci anche tu a migliorare il sito: pubblicheremo sui forum le lettere piu' interessanti.
Sondaggio
Come hai trovato il tuo attuale (o ultimo) lavoro?
Tramite un'agenzia.
Tramite un collega.
Con l'invio del curriculum direttamente all'azienda.
Grazie a referenze e presentazioni tramite un amico o un parente o un amico dell'amico.
Online sui siti di recruiting o grazie ai social network

Mostra i risultati (1518 voti)
Settembre 2026
Sciopero negli Apple Store italiani nel giorno dei nuovi iPhone
Anthropic chiude Cowork e lancia Claude Docs e Claude Slides
Attacco a Revolut, tra i dati rubati spunta una cartella Italy
Account Microsoft obbligatorio? Un link dimenticato nella configurazione aggira ancora il requisito
Anthropic, OpenAI e la paura di non riuscire a governare lo sviluppo della IA
La Cina accelera sui robot umanoidi militari
L'IA trova migliaia di vulnerabilità nel kernel Linux: manutentori sotto pressione
Windows 11, da ottobre Memory Integrity si attiva automaticamente
Windows 11, gli aggiornamenti richiederanno un solo riavvio al mese
Windows, come recuperare spazio su disco con la pulizia dell'archivio di sistema
Agosto 2026
Da Nokia un telefono retrò che funziona da powerbank e ha una torcia potentissima
L'IA minaccia lavoro, sicurezza e sviluppo umano. Ma Bill Gates ha la soluzione
Dopo 28 anni finisce la disputa su Linux: chiuso il caso iniziato da SCO nel 1998
Windows ha un comando nascosto che riduce l'ingombro del sistema
AliExpress usa l'audio dei dispositivi per tracciare gli utenti
Tutti gli Arretrati
Accadde oggi - 18 settembre


web metrics