Immagini, voce e video: come funziona davvero la parte multimediale

Come funziona

La chat e le immagini sono prodotte da sistemi completamente separati che comunicano a malapena. Questo solo fatto spiega perché il volto della tua compagna continua a cambiare e perché i contenuti multimediali sono la prima cosa che ogni app misura a consumo.

Potremmo ricevere una commissione dai link di questa pagina. Non cambia mai un voto.

Si tende a pensare che un’app di compagnia AI sia un’unica intelligenza capace di parlare, disegnare e usare la voce. In realtà sono tre o quattro sistemi distinti collegati dall’app, e la maggior parte delle frustrazioni in questa parte del prodotto nasce dalle giunture tra l’uno e l’altro.

Tre motori, una sola interfaccia

Il modello linguistico gestisce la conversazione. Produce testo e nient’altro.

Il modello di immagini è un sistema completamente diverso, di solito un modello di diffusione. Prende una descrizione testuale e produce un’immagine. Non ha mai visto la tua conversazione.

Il sistema vocale trasforma il testo in audio. Anche questo è separato e cieco a tutto tranne che alla frase che gli viene passata.

Quando chiedi un selfie alla tua compagna, succede questo: il modello linguistico scrive una breve descrizione dell’immagine richiesta, l’app aggiunge i tag di aspetto salvati per il personaggio, quel prompt combinato va al modello di immagini e ne torna una foto. La chat poi reagisce a un’immagine che non può vedere, basandosi sulla descrizione che ha scritto.

Quel passaggio di testimone è all’origine di quasi ogni lamentela sui contenuti multimediali in questa categoria.

Perché il volto continua a cambiare

Perché un modello di diffusione non recupera il tuo personaggio: genera qualcuno che corrisponda a una descrizione. «Capelli lunghi scuri, occhi verdi, venticinque anni circa» descrive milioni di volti, e ogni volta ne ottieni uno diverso.

Le app risolvono il problema in misura variabile:

  • Tag di aspetto salvati: la stessa stringa descrittiva ogni volta. Poco costosa e solo approssimativamente coerente.
  • Un’immagine di riferimento che condiziona ogni generazione. Molto meglio, ed è l’approccio usuale quando i volti restano riconoscibili.
  • Un modello ottimizzato per ogni personaggio: il più coerente e di gran lunga il più costoso, quindi tende a comparire solo nei piani più alti.

È un vero elemento di differenziazione, da provare nella versione gratuita prima di pagare. Genera quattro immagini dello stesso personaggio in situazioni diverse. Se ottieni quattro donne diverse, nessun abbonamento lo risolverà. La coerenza del personaggio tra le immagini è una parte importante del motivo per cui Candy AI guida la nostra classifica e per cui Secret Desires, che costruisce insieme aspetto, voce e personalità e aggiunge brevi video, ottiene il punteggio che ha.

Perché i contenuti multimediali sono sempre a consumo

Il testo costa poco. Generare una risposta in chat costa all’operatore una frazione di centesimo.

Un’immagine costa sensibilmente di più a ogni generazione. La voce si paga al secondo di audio. Il video è enormemente più caro dell’una e dell’altra.

Questa differenza di costo è l’intera ragione della struttura dei prezzi che vedi ovunque in questa categoria: allocazioni generose di messaggi, limiti stretti sulle immagini, minuti di voce venduti a parte, video riservato ai piani superiori. Non è scarsità artificiale pensata per farti passare a un piano più caro: è la forma reale del conto che riceve l’operatore, girato a te.

Ed è per questo che «illimitato» in questo mercato significa quasi sempre che è illimitato solo il testo. Leggilo così e le pagine dei prezzi diventano improvvisamente sensate. I conti sono in quanto costa davvero generare immagini.

Cosa aggiunge la voce e quanto costa

La voce cambia l’esperienza più di quanto si pensi. Leggere un messaggio e ascoltarlo sono cose diverse, e lo scarto è maggiore di quanto suggerisca la descrizione tecnica.

Due cose da controllare prima di pagare:

La latenza. Una pausa di tre secondi prima di ogni risposta rompe completamente l’illusione. Provala in una versione gratuita o in una prova, non da un video dimostrativo.

Se è una chiamata o un messaggio. I messaggi vocali, in cui il personaggio legge ad alta voce la sua risposta, sono comuni e poco costosi. Le chiamate in tempo reale, in cui parli e ti risponde, sono un altro prodotto e di solito un altro piano. Nomi elenca le chiamate vocali tra le sue funzioni; molte app scrivono «voce» e intendono messaggi vocali.

Cosa le immagini non fanno

Due limiti da conoscere prima di restare delusi:

Mani, testo e dettagli fini restano inaffidabili in tutti i generatori di questa categoria. Nessuno ha risolto il problema, e un’app che promette il contrario descrive il suo risultato migliore, non quello medio.

L’immagine non conosce la tua scena. Il modello della chat scrive un prompt di una riga, quindi tutto ciò che non c’è in quella riga sparisce: la stanza che hai descritto, come era vestita tre messaggi fa, l’ora del giorno. Essere espliciti nella richiesta risolve più problemi di qualunque impostazione.

Come valutare la parte multimediale in una sera

Consuma l’intera dotazione di una versione gratuita in una sola sessione, invece di un’immagine al giorno. Stai verificando quattro cose:

  1. Coerenza: quattro immagini, stesso personaggio, situazioni diverse.
  2. Aderenza al prompt: chiedi qualcosa di specifico e guarda quanto sopravvive.
  3. Latenza: sia per le immagini sia per la voce.
  4. Cosa conta ai fini del limite: se anche una generazione fallita o rifiutata ti costa.

Quest’ultimo punto è il meno documentato e il più fastidioso da scoprire dopo aver pagato. Insieme al resto di cosa includono davvero le versioni gratuite, è il genere di cosa che emerge solo quando usi il prodotto per bene.

Candy AI

4,6Voto: 4,6 su 5

L’unica app in cui chat, immagini e voce funzionano tutte dentro un solo abbonamento.

Prezzo
da 12,99 US$/mese
Versione gratuita
Sì
Italia
Disponibile

Domande frequenti

Perché la mia compagna è diversa in ogni immagine?

Perché il modello di immagini rigenera il personaggio ogni volta da una descrizione testuale. Le app che mantengono un volto stabile usano un riferimento salvato o un modello ottimizzato; quelle che non lo fanno tirano i dadi a ogni richiesta.

Perché la voce è limitata così rigidamente?

La sintesi vocale è fatturata in base alla durata dell’audio e costa all’operatore al secondo. Il testo costa ordini di grandezza in meno, ed è per questo che i limiti di messaggi sono generosi e i minuti di voce no.

Il modello di immagini vede la nostra conversazione?

Solo attraverso un breve prompt che l’app scrive per lui. Non ha accesso alla tua cronologia, ed è per questo che un’immagine spesso manca un contesto che nella chat sembrava ovvio.