AI & AutomationNieuwsAI-generated

Arena meet bij Claude Opus 5.5 95 procent minder gedachtestreepjes, maar langere antwoorden

Het gedachtestreepje — dat lange streepje dat in AI-teksten opdook als een soort handtekening — is bij Claude vrijwel verdwenen. Benchmarkplatform Arena analyseerde tienduizenden echte antwoorden uit zijn Text Arena en zag het gebruik ervan met ongeveer 95 procent dalen tussen Opus 5 en Opus 5.5. BleepingComputer beschreef de analyse op 26 september.

De cijfers

Arena keek naar antwoorden uit augustus en september 2026, in de categorie met hoge redeneerinspanning. De opvallendste uitkomsten:

  • Gedachtestreepjes: van 15,2 naar 0,8 per duizend woorden
  • Puntkomma's: van 6,10 naar 1,64 per duizend woorden
  • Zinslengte: van gemiddeld 12,14 naar 10,03 woorden per zin
  • Antwoordlengte: van gemiddeld 453 naar 481 woorden

Volgens Arena bewogen tien van de twaalf gemeten schrijfeigenschappen in wat het als de betere richting beschouwt. Arena publiceerde de bevindingen zelf op X.

Waarom juist dat streepje

Het gedachtestreepje is de afgelopen jaren uitgegroeid tot het bekendste verklikkertje van door AI geschreven tekst. Niet omdat het fout is — het is volstrekt correcte interpunctie — maar omdat taalmodellen het veel vaker gebruikten dan menselijke schrijvers, en vaak in hetzelfde ritmische patroon. Redacties, docenten en detectietools gingen erop letten. Dat 15,2 per duizend woorden terugvalt naar minder dan één is geen toevalstreffer; zo'n verschuiving wijst op gericht bijsturen tijdens de training of in de systeeminstructies.

Dezelfde beweging zie je bij de puntkomma's, ook zo'n leesteken dat in AI-proza oververtegenwoordigd was. En de kortere zinnen passen in het beeld: minder ingewikkeld geneste constructies, meer hoofdzinnen.

De keerzijde: langere antwoorden

Tegenover die winst staat een verlies. Met gemiddeld 481 woorden per antwoord is Opus 5.5 volgens Arena's vergelijking het meest breedsprakige Opus-model tot nu toe. De zinnen werden korter, maar er kwamen er meer bij.

Dat is voor gebruikers geen detail. Wie het model inzet voor samenvattingen, commit messages of korte e-mails, betaalt langere antwoorden in tokens én in leestijd. En bondigheid is precies het punt waarop veel mensen taalmodellen bijsturen met expliciete instructies.

Wat dit wel en niet is

Een kanttekening bij de interpretatie: dit is een meting van een derde partij, geen aankondiging van Anthropic. Arena analyseert de uitvoer van modellen zoals die in zijn eigen arena terechtkomt, en daar zitten prompts van gebruikers omheen die het resultaat mede bepalen. De cijfers zeggen iets over hoe het model in de praktijk schrijft, niet rechtstreeks iets over wat er in de training is veranderd — Anthropic heeft zich hierover niet uitgelaten.

Wat de meting wél laat zien, is dat schrijfstijl inmiddels een expliciete ontwerpkeuze is geworden. Waar modelvergelijkingen jarenlang over benchmarkscores op code en wiskunde gingen, wordt nu ook bijgehouden hoe vaak een model een bepaald leesteken zet. Voor iedereen die dagelijks tekst laat schrijven of redigeren door een model, is dat een relevanter getal dan menige benchmark.