Mentre il cloning vocale ha a lungo fatto affidamento su campioni audio esistenti — come visto con Qwen3-TTS in llama.cpp — Gradium sta spostando il paradigma verso la sintesi generativa. L'azienda parigina, nata dal laboratorio di ricerca Kyutai, ha rilasciato Voice Design, un sistema che genera voci sintetiche completamente nuove basandosi esclusivamente su descrizioni scritte, eliminando la necessità di audio di riferimento o accordi di licenza con speaker umani.
Dal casting brief all'API
Voice Design opera traducendo un prompt testuale (fino a 500 caratteri) in caratteristiche vocali. Il modello risponde ad attributi specifici come genere, fascia d'età, accento o origine, pitch, ritmo, energia, timbro, risonanza e registro. Gradium consiglia di includere nel prompt l'uso previsto della voce per guidare meglio l'interpretazione e il registro.
Una singola richiesta genera tra 1 e 5 candidati in un tempo che va dai 3 ai 5 secondi. Si tratta di variazioni di un singolo personaggio; per creare una persona diversa è necessaria una nuova descrizione piuttosto che più campioni. Il processo di campionamento è non deterministico: anche con un seed fisso, l'espansione interna del prompt varia, il che significa che i candidati non salvati vengono eliminati dopo 30 giorni.
Pipeline di produzione e integrazione
Il passaggio da candidato a voce pronta per la produzione segue un flusso API in quattro fasi:
POST /voice-generator/generatecrea gli ID dei candidati.GET /voice-generator/embeddingsinterroga il sistema per verificarne la disponibilità.- I candidati vengono testati tramite l'endpoint TTS standard utilizzando l'ID del candidato come
voice_id. POST /voices/from-embeddingpromuove un candidato selezionato a voce permanente.
Una volta convertite, queste voci funzionano come normali entità voice_id attraverso gli endpoint REST, WebSocket e Speech-to-Speech. Il servizio è disponibile in inglese, francese, spagnolo, portoghese e tedesco. Per quanto riguarda l'accessibilità, Voice Design è integrato nell'API di Gradium e in Studio, disponibile su tutti i piani, incluso quello gratuito che permette fino a 5 slot per voci personalizzate.
Benchmark sugli accenti regionali
I test di ascolto ciechi a coppie condotti internamente da Gradium su 7.627 confronti mostrano un tasso di vittoria del 72,6% rispetto ad altri sistemi API pubblici, tra cui ElevenLabs (59,0%) e Inworld (44,8%). I guadagni di performance più significativi sono stati osservati negli accenti regionali che solitamente vengono appiattiti dai cataloghi standard: francese quebecchese (97%), spagnolo rioplatense (86%) e tedesco bavarese (85%). Questi risultati sono stati confermati da un giudice modello basato su Gemini 3.1 Pro, che ha posizionato Gradium al primo posto con un punteggio di 4,06.

Ancora nessun commento. Puoi essere il primo!