Claude batte GPT, ma non convince ancora

Uno studio condotto da Wortliga per conto di Sistrix ha messo a confronto 2112 testi di marketing B2B generati da Claude, Gemini e GPT. Il risultato è inequivocabile: nessun modello è in grado di scrivere in modo sufficientemente comprensibile senza un prompt preciso – e questo comporta dei rischi per le aziende.

La lunghezza delle frasi influisce sulla comprensibilità dei testi di marketing. Fonte: zvg

I modelli linguistici basati sull'intelligenza artificiale sono considerati strumenti efficaci per il marketing e le vendite. Ma quanto sono davvero efficaci? Uno studio condotto da Wortliga per conto del fornitore di analisi SEO Sistrix offre per la prima volta un confronto sistematico tra i modelli di punta di Anthropic, Google e OpenAI, giungendo a una conclusione deludente.

2112 testi, undici generi, tre modelli

L'analisi ha riguardato 2112 testi B2B appartenenti a undici generi testuali, tra cui post sui social media, e-mail pubblicitarie, articoli di blog ottimizzati per la SEO, casi di studio e white paper. La qualità dei testi è stata misurata in base al punteggio WORTLIGA, che valuta la leggibilità, gli ostacoli linguistici quali frasi complesse e gergo passivo, nonché lo stile e il contenuto. I testi sono considerati comprensibili solo a partire da un punteggio di 60 punti.

GPT 5.5 all'ultimo posto nella classifica WORTLIGA. Fonte: zvg

Il risultato: Claude Opus 4.7 di Anthropic si è classificato al primo posto, fornendo i risultati linguistici più stabili in tutti i settori, con un punteggio medio di 47,7 punti. Gemini 3.1 Pro (versione preliminare) di Google si è classificato al secondo posto con 46,8 punti, ma si è distinto per un evidente accumulo di frasi fatte e parole di riempimento. Il modello GPT 5.5 di OpenAI si è classificato all’ultimo posto con soli 37,7 punti. In assenza di regole precise, tende a utilizzare un linguaggio burocratico e un gergo tecnico complesso.

L'uso incontrollato dell'IA è rischioso

Il responsabile dello studio, Gidon Wagner di Wortliga, trae una conclusione chiara: «I risultati dimostrano che la comunicazione incontrollata basata sull’intelligenza artificiale nel marketing e nelle vendite è rischiosa». Nessuno dei tre modelli ha raggiunto la soglia dei 60 punti per i testi comprensibili: persino il modello migliore è rimasto ben al di sotto di tale soglia.

Nessun modello di IA raggiunge l'intervallo verde di comprensibilità. Fonte: zvg

Per Johannes Beus, fondatore e CEO di Sistrix, non si tratta solo di questioni di stile: «Il fatto che un testo venga interpretato correttamente da un sistema di intelligenza artificiale dipende, tra l’altro, dalla sua chiarezza linguistica e dalla sua struttura. Il linguaggio non è più una questione di gusto. Ciò che per molto tempo è stato considerato un ‹nice to have›, oggi rappresenta un importante criterio di qualità sia dal punto di vista dell’accessibilità che in termini di contenuti leggibili dalle macchine.»

L'effetto camaleonte nel prompting

Un altro risultato fondamentale dello studio è il cosiddetto “effetto camaleonte”: se un prompt presenta uno stile distaccato e formale, i modelli lo adottano inevitabilmente – e la comprensibilità cala drasticamente. In media, in tali condizioni i testi hanno raggiunto solo 4,4 punti. Le e-mail pubblicitarie sembravano allora delle comunicazioni ufficiali. Questo comportamento era particolarmente marcato nel caso di GPT 5.5.

Claude ne è l'esempio perfetto, mentre GPT è un fallimento totale. Fonte: zvg

In presenza di prompt approssimativi, i sistemi hanno persino ignorato le regole relative a determinati tipi di testo. Ciò dimostra che non è il modello da solo a determinare la qualità, bensì la qualità delle istruzioni che gli vengono fornite.

L'uomo rimane indispensabile

Lo studio rileva che i modelli di IA non sono in grado, di per sé, di scrivere testi B2B convincenti. Gidon Wagner va dritto al punto: «I dati dimostrano che i modelli di IA non sono in grado, di per sé, di scrivere testi B2B convincenti.» Johannes Beus aggiunge nella prefazione dello studio: «Si tratta di un’analisi onesta di ciò che l’intelligenza artificiale è effettivamente in grado di fare oggi e dei ambiti in cui l’uomo rimane ancora indispensabile.»

I testi generati dall'intelligenza artificiale sono di facile lettura, ma poco approfonditi. Fonte: zvg

 

Ulteriori informazioni: https://wortliga.de/

(Visitato 182 volte, 1 visita oggi)

Altri articoli sull'argomento