Fish Audio
Fish Audio is an AI voice platform for generating expressive speech, cloning voices, transforming recordings, transcribing audio, and integrating real-time voice technology into applications.
Fish Audio est une plateforme de génération vocale basée sur l’IA, conçue pour les créateurs de contenu, les développeurs, les podcasteurs, les producteurs de livres audio, les studios de jeux, les spécialistes du marketing et les entreprises.
Son système principal de synthèse vocale convertit les scripts écrits en audio naturel et expressif à l’aide de voix prêtes à l’emploi, de modèles créés par la communauté, de clones vocaux personnalisés ou d’enregistrements de référence fournis directement lors de la génération.
Les utilisateurs peuvent créer de l’audio via le playground accessible depuis le navigateur, ou intégrer la technologie dans des applications grâce à son API et aux SDK officiels Python et JavaScript.
La technologie de clonage vocal S2 de la plateforme peut créer une voix synthétique utilisable à partir d’environ 10 secondes d’audio de référence propre.
Une voix clonée peut reproduire des caractéristiques telles que le ton vocal, la cadence, l’émotion, les hésitations et le style de parole.
Ses capacités multilingues permettent à une voix clonée dans une langue de parler d’autres langues prises en charge sans réentraînement.
Le clonage vocal doit uniquement être effectué avec l’autorisation de la personne concernée et dans le respect des lois applicables à l’identité, à l’image, à la divulgation et aux médias synthétiques.
Fish Audio prend en charge la narration à locuteur unique ainsi que les dialogues à plusieurs locuteurs.
Avec le modèle S2-Pro, les développeurs peuvent attribuer des voix distinctes à différentes balises de locuteur, ce qui rend la plateforme utile pour les podcasts, les conversations fictives, les livres audio, les jeux, les scénarios de formation et la narration audio.
Des contrôles sont disponibles pour ajuster la vitesse de parole, le volume, l’expressivité, la diversité, la qualité de sortie et le format audio.
Le streaming en temps réel prend en charge la génération vocale à faible latence pour les agents conversationnels, les personnages interactifs, les applications de service client, les jeux et d’autres produits nécessitant une réponse vocale avant le traitement complet du script.
La sortie est disponible dans des formats tels que MP3, WAV, PCM et Opus, avec plusieurs options de fréquence d’échantillonnage et de débit binaire.
Fish Audio fournit également des capacités de transcription via son API, avec des transcriptions, des horodatages et des résultats segmentés à partir de l’audio téléversé.
L’API développeur utilise une tarification à l’utilisation sans minimum mensuel, tandis que les droits commerciaux pour les voix clonées sont inclus avec l’accès payant éligible.
Le modèle S2 de Fish Audio est également présenté comme open source et adapté au déploiement auto-hébergé.