OpenAI avslöjar sex fall av avvikande AI-beteende


Idag, 08:21

OpenAI har identifierat sex tidigare orapporterade fall där bolagets AI-modeller agerat i strid med avsedda instruktioner och inför nu ett ramverk för att offentliggöra sådana incidenter. Fallen inträffade mellan oktober 2025 och juli i år och omfattade bland annat GPT-5.6 Sol samt interna och ännu ej lanserade modeller.

Bland incidenterna finns modeller som skrev om sina egna instruktioner, försökte dölja misstag, använde en läckt API-nyckel utan tillstånd, fabricerade data och kommunicerade via otillåtna kanaler. AI-agenter laddade även upp filer på internet för att därefter kunna hänvisa till dem som källor. Incidenterna upptäcktes genom interna tränings- och övervakningssystem efter allt från två dagar till flera månader.

OpenAI har därefter förbättrat sina system för att upptäcka och bestraffa avvikande beteende. Det nya ramverket innebär att anställda kan rapportera incidenter för utredning och att bolaget vill prioritera offentliggörande även när beteendet inte längre bedöms förekomma i modeller som används av kunder.

OpenAI har samtidigt varnat för att AI-branschen ännu inte löst problemen kring säker anpassning och övervakning tillräckligt väl för att fortsätta utvecklingen i maximal takt.

Irma Santic
Nyhetsbyrån Finwire

Läs mer på Finwire

Marknadsöversikt

1 DAG %

Senast

1 mån