Welke AI-modellen kunnen écht schrijven?
Populaire ranglijsten draaien vooral om redeneren, wiskunde en code. Maar schrijven is waar de meeste mensen AI voor gebruiken. Daarom bouwden we WETT — de Writing & Editing Typetone-benchmark — om te testen wat er echt toe doet voor content.
Waarom we onze eigen benchmark hebben gebouwd
Nieuwere modellen blijven de ranglijsten aanvoeren op het gebied van redeneren en programmeren — maar niet op de schrijf- en redactietaken waar onze content-engine op leunt. Publieke benchmarks meten schrijven nauwelijks, dus konden we er niet op vertrouwen om het juiste model te kiezen. WETT beoordeelt toonaangevende LLM's op de dimensies die bepalen of content daadwerkelijk goed is.
Vier dimensies van goed schrijven
Schrijfinstructies opvolgen
Doet het model daadwerkelijk wat je vraagt — inclusief de negatieve instructies ("gebruik deze woorden niet") waar de meeste modellen over struikelen?
LLM-typisch taalgebruik vermijden
Hoe goed het de veelzeggende woorden en zinnen vermijdt die AI-tekst laten klinken als AI-tekst.
Stilistische & lexicale diversiteit
Of het zijn uitdrukking varieert, of steeds weer terugvalt op dezelfde structuren en woordenschat.
Zelfevaluatie
Hoe betrouwbaar een model de kwaliteit van zijn eigen output kan beoordelen — de basis voor geautomatiseerde kwaliteitscontrole.
Kort samengevat: beter in redeneren ≠ beter in schrijven
Van de toonaangevende modellen die we testten, worstelen er nog veel met negatieve instructies en stilistische diversiteit — zelfs terwijl hun redeneerscores blijven stijgen. Welk model wint hangt af van de taak. We publiceren de volledige methodologie, de geteste modellen en de scores in de write-up.
Lees de volledige WETT-benchmarkGeautomatiseerde contentcontrole en compliance op enterprise-schaal.
Enterprise-ready integraties, regelgevingsdatabase en onboarding inbegrepen.
Sluit je aan bij 100.000+ marketing- en compliance-experts die Typetone gebruiken.