IA + agentes

6 min · Jul 25

Fish.audio: la voz por IA (TTS) abierta que está cambiando los agentes de voz

Qué es Fish.audio, cómo funcionan su TTS y clonación de voz, y qué aporta el auge de los modelos de voz abiertos a los agentes de voz de un negocio.

Si estás explorando cómo darle voz a un agente de IA, tarde o temprano vas a toparte con Fish.audio. Es una de las plataformas de texto a voz (TTS, por text-to-speech) que más ha crecido entre desarrolladores, en buena parte porque apuesta por modelos abiertos, clonación de voz y precios más accesibles que las opciones cerradas premium. En esta guía explicamos qué es, cómo funciona y qué significa para quien quiere que su negocio conteste llamadas con una voz natural.

¿Qué es Fish.audio?

Fish.audio (https://fish.audio) es una plataforma de síntesis de voz: le das texto y te devuelve audio hablado. Lo que la distingue no es solo el sitio web para generar audio, sino su familia de modelos abiertos —conocidos como Fish-Speech y, más recientemente, la línea OpenAudio— pensados para que desarrolladores los usen vía API o incluso los ejecuten en su propia infraestructura. Alrededor de eso hay un mercado comunitario de voces, donde se comparten y descubren voces creadas por otros usuarios.

Cómo funcionan el TTS y la clonación de voz

El flujo básico de TTS es fácil de entender: el modelo convierte una cadena de texto en una forma de onda de audio que suena como una persona hablando. La parte interesante de Fish.audio es la clonación de voz: a partir de una muestra de audio relativamente corta, el sistema puede generar una voz nueva que imita el timbre y el estilo de esa muestra.

Text-to-speech: un modelo transforma texto plano en una forma de onda de audio hablada.
  • Texto a voz (TTS): escribes el guion y el modelo lo lee con una voz sintética.
  • Clonación de voz: subes una muestra y obtienes una voz personalizada con ese timbre.
  • Marketplace de voces: exploras y reutilizas voces creadas por la comunidad.
  • Acceso por API: integras la generación de audio en tu propio producto o flujo.
  • Autoalojamiento: al ser modelos abiertos, puedes ejecutarlos en tu infraestructura si lo necesitas.

Clonar una voz conlleva responsabilidad. Usa solo voces sobre las que tengas permiso o derechos, y sé transparente con tus contactos cuando hablan con un agente de IA. La naturalidad no debería servir para engañar sobre quién —o qué— está del otro lado.

Modelos abiertos vs. voces premium cerradas

Aquí conviene ser honesto sobre los trade-offs. Las opciones de voz cerradas y premium suelen llevar la delantera en naturalidad y consistencia, sobre todo en idiomas y acentos específicos. Los modelos abiertos como los de Fish.audio han cerrado mucho esa brecha y ofrecen ventajas claras: menor costo, más control y la posibilidad de autoalojar.

Comparar voces no es solo "cuál suena mejor": pesa naturalidad, consistencia, idioma, costo y control.
  • A favor de lo abierto: costo más bajo, transparencia, capacidad de autoalojar y no depender de un solo proveedor.
  • A favor de lo cerrado premium: suele ganar en naturalidad y en consistencia fina, en especial en ciertos idiomas y acentos.
  • El factor idioma: el resultado en español latinoamericano puede variar bastante entre modelos; conviene probar con tu propio guion antes de decidir.

¿Dónde encaja en un agente de voz real?

Una cosa es generar un clip de audio bonito y otra muy distinta sostener una llamada telefónica real. Un agente de voz que contesta el teléfono necesita mucho más que un buen TTS: tiene que escuchar (reconocimiento de voz), entender e improvisar (el modelo de lenguaje), responder con baja latencia, manejar las interrupciones cuando la persona habla encima y saber cuándo pasar la llamada a un humano.

  1. Reconocimiento de voz (STT) para transcribir lo que dice la persona.
  2. Un modelo de lenguaje que entiende, razona y decide qué responder.
  3. TTS (como Fish.audio) para convertir esa respuesta en voz natural.
  4. Baja latencia y manejo de interrupciones para que la conversación fluya.
  5. Escalado a un humano cuando la situación lo requiere.

El TTS —sea Fish.audio u otro— es una sola pieza de ese rompecabezas. Ensamblar el sistema completo por tu cuenta es un proyecto de ingeniería considerable: hay que orquestar voz, latencia, memoria de la conversación e integraciones con tu negocio.

De la voz suelta al agente completo

Si tu objetivo final es que tu negocio conteste llamadas y mensajes con una voz natural, Fish.audio es una pieza que vale la pena conocer, pero no tienes que convertirte en integrador para llegar ahí. Blind Agents junta la voz, el lenguaje y las integraciones en un solo agente que contesta WhatsApp, llamadas y correo, sin código, y que escala a una persona de tu equipo cuando hace falta. Tú te concentras en el negocio; nosotros, en que suene bien.

Fish.audio: la voz por IA (TTS) abierta que está cambiando los agentes de voz · Blind Agents