AcasăCentrul de știri LBank
Anthropic marchează discret cu watermark fiecare rezultat generat de Claude AI. Dezvoltatorii încearcă deja să-l spargă
anthropic-quietly-watermarking-ai-claude-output-builders-break
Anthropic marchează discret cu watermark fiecare rezultat generat de Claude AI. Dezvoltatorii încearcă deja să-l spargă
Anthropic țese un filigran invizibil, lizibil de către mașini, în fiecare cuvânt pe care îl scriu cele mai noi modele Claude — și nu a spus cum.
2026-08-13 Sursă:decrypt.co

Pe scurt

  • Noile modele Claude lansate în UE la sau după 2 august 2026 încorporează un filigran lizibil de mașină în fiecare bucată de text generat, aplicat la nivel de model.
  • Marcajele se aplică la nivel mondial pe Claude, API, Claude Code și partenerii cloud.
  • Proiecte open-source pentru eliminarea lor au apărut în câteva zile.

Anthropic a început să integreze un filigran imperceptibil în tot textul generat de cele mai noi modele Claude. Modificarea a intrat în vigoare pentru modelele lansate în UE la 2 august 2026, iar Anthropic afirmă că se va aplica la nivel mondial.

Anthropic a prezentat planul într-un articol de asistență după ce a semnat Codul de Conduită al Legii AI din UE privind transparența. Cu alte cuvinte, nu se oferă exact voluntar să facă acest lucru. Marcajul atinge fiecare suprafață Claude, de la chatbot și API până la Claude Code și partenerii cloud precum AWS, Google Cloud și Microsoft Foundry.

Myriad: Când va lansa OpenAI GPT-6? Apasă pentru a face predicția ta.

„Când un model Claude acceptat generează text, acesta inserează un filigran imperceptibil direct în textul în sine. Nu îl vei vedea și nu modifică sensul, calitatea sau lizibilitatea răspunsului lui Claude”, a declarat Anthropic. „Deoarece filigranul face parte din text, acesta va călători cu textul atunci când este copiat și lipit în altă parte și poate persista prin anumite editări.”

Așadar, este puțin mai complex decât metodele obișnuite la care utilizatorii tind să se gândească. Atunci când un model Claude acceptat scrie text, acesta inserează un filigran imperceptibil direct în cuvinte, fără nicio etichetă vizibilă. Deoarece marcajul face parte din text, acesta supraviețuiește operațiunii de copiere-lipire și, admite Anthropic, „poate persista chiar și după unele editări”. Fișierele primesc un al doilea strat: metadate semnate conform standardului deschis C2PA (gândiți-vă la un manifest digital de expediere care înregistrează cine a produs un fișier și dacă cineva l-a modificat ulterior).

Metoda rămâne secretă

Anthropic nu a precizat cum este realizat filigranul. Articolul de asistență îl numește la nivel de model (modelul este antrenat cu acesta) și text-nativ (nu este un instrument extern precum un generator de metadate, de exemplu), dar documentația de detectare și tehnica exactă nu au fost încă publicate.

Cercetătorii deduc că este o semnătură statistică: modelul își orientează alegerile de cuvinte către o părtinire slabă, detectabilă, aceeași familie de abordări pe care Google o folosește în SynthID Text. Aceasta rămâne o presupunere până când Anthropic va publica detectorul.

Dar asta nu îi descurajează pe entuziaștii confidențialității, iar unii experți lucrează deja la metode de a sparge filigranarea secretă a lui Anthropic. mikiane/claude-watermark-cleaner (106 stele pe Github) elimină caracterele Unicode invizibile, apoi rescrie textul cu un model non-Claude pentru a perturba modelul de token-uri.

Un proiect mai mare, guillaumemeyer/watermarks-remover (4.6k stele pe Githum), elimină marcajele de text Claude, plus semnalele de clasă C2PA și SynthID din fișierele PNG, JPEG, SVG, PDF și DOCX. Autorii susțin că un marcaj de text statistic „nu este o modalitate fiabilă de a dovedi originea” și, în mare parte, îi obligă pe utilizatori să facă o a doua trecere a modelului pentru a-și curăța propriul scris. Nicio eliminare nu poate fi garantată până când Anthropic nu își va lansa detectorul și pragurile.

Propria istorie a Anthropic face ca reacția privind confidențialitatea să fie mai acută. Compania a eliminat un tracker ascuns Claude Code în martie, după ce cercetătorii au descoperit că eticheta locația și utilizarea proxy a unor utilizatori prin markeri Unicode nedezvăluiți – aceeași tehnică de marcare discretă aflată acum în centrul planului de filigranare.

Marcajul demonstrează că Claude a contribuit la text, nu că l-a scris în întregime, așa că va trata o scriere originală cu o mică editare la fel ca un text generat integral de AI. Cereți-i lui Claude să corecteze sau să traducă paragraful dumneavoastră și rezultatul poate purta în continuare semnalul. Anthropic recunoaște deschis că editarea intensă îl poate elimina și că un marcaj lipsă nu demonstrează că un om a scris ceva.

Un proiect de lege din SUA, Actul COPIED, susține aceeași idee: o modalitate standardizată de a filigrana conținutul AI, astfel încât platformele să-i poată urmări originea. Așa cum a arătat problema de șantaj a lui Claude, modelele companiei atrag deja o examinare intensă asupra a ceea ce fac cu textul pe care îl ating.

Anthropic nu a precizat când va publica instrumentele de detectare care ar permite oricui să verifice marcajul.