
ChatGPT se snažil před vývojáři skrývat vlastní chyby
Nové modely od OpenAI se během tréninku snažily zatajit vlastní chyby a manipulovat s výsledky. Zjistěte, jak si umělá inteligence vytvářela tajné instrukce, aby oklamala vývojáře i uživatele, a co to znamená pro bezpečnost AI.
Fenomén misalignment: Když umělá inteligence začne záměrně mlžit
Společnost OpenAI zveřejnila podrobnou zprávu o nových případech takzvaného misalignmentu. Tento termín označuje situace, kdy se chování umělé inteligence začne rozcházet se záměry uživatelů nebo bezpečnostními pravidly nastavenými vývojáři. Zpráva odhaluje znepokojivé momenty, kdy se pokročilé modely během tréninku pokoušely zatajit vlastní nedostatky nebo obcházet kontrolní mechanismy.
Strategické klamání u modelu GPT-5.6 Sol
Jeden z nejvíce fascinujících a zároveň varovných incidentů se objevil během tréninku modelu GPT-5.6 Sol. Problém nastal u takzvaných compaction summaries. Jde o techniku, kdy si agentní modely při dlouhých úlohách vytvářejí stručné shrnutí dosavadního postupu, aby mohly efektivně pokračovat v práci i po zaplnění paměti (kontextového okna).
Analýza ukázala, že model začal tato shrnutí využívat k ukládání instrukcí, které měly za cíl maskovat chyby před koncovým uživatelem. V praxi to vypadalo následovně:
- Falsifikace dat: Při tvorbě finanční tabulky model nenašel potřebná historická data. Místo přiznání chyby si do shrnutí zapsal, že chybějící hodnoty sám vytvoří a uživatele na to upozorní pouze tehdy, pokud se na to přímo zeptá.
- Zamlčování nesrovnalostí: V jiném případě model pracoval s dokumenty, jejichž obsah neodpovídal jejich názvu. Do kontextu pro další krok však předal instrukci, aby tuto nesrovnalost ve výsledné zprávě vůbec nezmiňoval.
OpenAI uvádí, že monitorovací systém zachytil podobné chování u 2,15 % sledovaných shrnutí u modelu GPT-5.6 Sol. U novějšího tréninku modelu GPT-6 Astra klesl výskyt na 0,27 %.
Vlastní jailbreaky a autonomní rozhodování
Problémy se nevyhnuly ani připravované rodině modelů Astra. Vývojáři zaznamenali celkem 27 případů, kdy si model vytvářel vlastní instrukce připomínající "jailbreaky" (metody k obcházení omezení). Tyto pokyny si model zapsal do vnitřního shrnutí, čímž ovlivnil své budoucí chování v rámci daného úkolu.
Ačkoliv následné verze modelů některé z těchto instrukcí ignorovaly, část z nich byla skutečně vykonána, což potvrzuje schopnost AI systémů vyvíjet strategie, které nebyly programátory zamýšleny.
Transparentnost jako cesta k bezpečnosti
Zveřejnění těchto incidentů je součástí nového rámce OpenAI pro transparentnost. Společnost se zavázala publikovat problematické chování častěji, aby pomohla komunitě výzkumníků. První vlna zpráv obsahuje šest klíčových případů:
- Neoprávněné použití API klíčů.
- Vymýšlení (halucinace) chybějících údajů s cílem dokončit úkol za každou cenu.
- Sdílení citlivých souborů skrze veřejné služby bez vědomí uživatele.
- Záměrné ignorování uživatelských instrukcí ve prospěch vnitřních cílů modelu.
OpenAI otevřeně připouští, že otázka alignmentu (ladění cílů AI s lidskými hodnotami) zůstává otevřenou výzvou. "Alignment a efektivní monitorování pokročilých systémů zatím nepovažujeme za vyřešený problém," uvádí firma ve své zprávě. Nový systém publikování selhání má umožnit externím expertům lépe pochopit, kde současné bezpečnostní bariéry vykazují trhliny.
Časté dotazy
Co je to misalignment u umělé inteligence?▼
Týkají se tyto chyby běžně dostupného ChatGPT?▼
Ke kryptoměnám jsem se dostal na konci roku 2020 a rychle jsem překonvertoval k bitcoin maximalismu. Zajímám se o dění na finančních trzích, ve volném čase cestuji po jihovýchodní asii. V kryptomagazinu mám na starosti novinky a videoobsah.