Bland vypustila benchmarkově nejlepší model Text-to-Speech v3
Společnost Bland vydala model Bland Speech v3, který se umístil na druhém místě v soutěži Audio Realism Bench hned po skutečnému lidskému hlasu. Model zachovává přirozenosti řeči jako oddechovávání a zaváhávání, dostupný prostřednictvím API i v interaktivním studiu za jednotnou cenu 0,015 USD za 1000 znaků. Služba také umožňuje klonování hlasu z krátké audio ukázky a generování řeči na základě textových popisů.
Jak se Bland Speech v3 liší od klasického TTS?
Bland Speech v3 je navržen pro přirozenost konverzace a zachovává prvky jako oddechování, zaváhání a přirozenou intonaci. Typické TTS systémy mají tendenci znít uměle a příliš leštěně, zatímco Bland Speech si ponechává zbytky těchto lidských caractéristik.
Jaké jsou možnosti klonování hlasu?
Služba nabízí dva typy klonování: okamžité klonování z 10 sekund zvuku a profesionální klonování z 30 minut ověřeného zvuku. Obě možnosti vyžadují potvrzení, že máte právo zvuk používat.
Jak se Bland Speech v3 integruje do aplikací?
Integrace probíhá prostřednictvím REST API endpointu POST /v1/speak, který přijímá text, identifikátor hlasu a vrací zvuk. Výstup lze streamovat přes HTTP chunky nebo WebSocket a je dostupný v různých formátech včetně PCM16 WAV.
- Gradium TTS: už si nemusíte vybírat mezi latencí a přesností — gradium.ai 74 % shoda
- Experiment s Gemma 4 jako offline překladačem — github.com 68 % shoda
- Naomi Bashkanksy opouští OpenAI aby mohla v Condu rozvíjet čtení myšlenek pomocí AI — naomibashkansky.com 68 % shoda
- Bland
- Bland Speech v3
- Audio Realism Bench
- intelligence.ai