¿Qué modelos de IA realmente saben escribir?
Las clasificaciones populares se obsesionan con el razonamiento, las matemáticas y el código. Pero escribir es el uso número uno de la IA. Por eso creamos WETT — el benchmark Writing & Editing Typetone — para evaluar lo que realmente importa para el contenido.
Por qué creamos nuestro propio benchmark
Los modelos más nuevos siguen liderando las clasificaciones en razonamiento y programación, pero no en las tareas de escritura y edición de las que depende nuestro motor de contenido. Los benchmarks públicos apenas miden la escritura, así que no podíamos confiar en ellos para elegir el modelo adecuado. WETT evalúa a los LLM líderes en las dimensiones que determinan si un contenido es realmente bueno.
Cuatro dimensiones de una buena redacción
Seguir instrucciones de redacción
¿El modelo realmente hace lo que se le pide, incluidas las instrucciones negativas ("no uses estas palabras") con las que tropiezan la mayoría de los modelos?
Evitar el lenguaje típico de los LLM
Qué tan bien evita las palabras y frases delatoras que hacen que un texto de IA suene a texto de IA.
Diversidad estilística y léxica
Si varía su expresión, o si recurre una y otra vez a las mismas estructuras y vocabulario.
Autoevaluación
Con qué fiabilidad un modelo puede juzgar la calidad de su propio resultado — la base del control de calidad automatizado.
En resumen: mejor en razonamiento ≠ mejor en escritura
Entre los modelos líderes que probamos, muchos todavía tienen dificultades con las instrucciones negativas y la diversidad estilística, incluso mientras sus puntuaciones de razonamiento siguen subiendo. Qué modelo gana depende de la tarea. Publicamos la metodología completa, los modelos probados y las puntuaciones en el artículo.
Leer el benchmark WETT completoAuditoría de contenido automatizada y cumplimiento normativo a escala empresarial.
Integraciones listas para la empresa, base de datos normativa y onboarding incluidos.
Únete a más de 100.000 expertos en marketing y cumplimiento que usan Typetone.