Fish Audio, startup con sede en Palo Alto, ha anunciado una ronda de financiación semilla de 52 millones de dólares liderada por Coreline Ventures y Capital Today. La empresa, fundada por la investigadora Shijia Liao, desarrolla modelos de voz generados mediante inteligencia artificial para aplicaciones creativas y empresariales.
Desde su lanzamiento el año pasado, Fish Audio cuenta con más de 8 millones de usuarios que utilizan versiones open source o de pago de sus modelos de voz, generando una facturación anual recurrente de 21 millones de dólares. Su biblioteca incluye más de 15 000 controles de lenguaje natural para adecuar la expresividad y flexibilidad de las voces a distintos usos.
Fish Audio ha desarrollado cinco modelos en el último año: cuatro para generación de voz y uno para transcripción de voz a texto, tres de los cuales son open source. Su modelo más reciente, S2.1 Pro, está disponible únicamente mediante API de pago. La compañía ofrece planes mensuales para creadores y equipos que incluyen minutos de generación y clonación de voz, además de una versión empresarial usada por compañías como HeyGen y Sanas.
La empresa ha implementado un proceso automatizado para remover voces subidas sin consentimiento tras denuncias de creadores por uso no autorizado. Los usuarios pueden solicitar la eliminación aportando una muestra de voz o un contrato, y la retirada se procesa en menos de tres minutos.
Entre sus planes futuros figura el lanzamiento de un modelo para comprensión de audio y un modelo de voz a voz. El mercado de generación de voz sintética es competitivo con empresas como ElevenLabs, WellSaid, Cartesia, Speechify, Async y Krisp.
Financiadores como 359 Capital valoran la precisión técnica y eficiencia en el entrenamiento de sus modelos, aspecto clave para competir con grandes laboratorios de IA. Fish Audio pretende consolidarse ofreciendo mayor control y calidad tanto para desarrolladores independientes como para clientes corporativos.


