Visión general
La transcripción de audio convierte los audios de la conversación en texto y lo muestra debajo del reproductor, dentro de la propia burbuja del mensaje. El agente lee el mensaje sin darle play — útil en un entorno ruidoso, al atender varias conversaciones a la vez y para encontrar después un audio por lo que se dijo en él.
Funciona en cualquier canal que reciba audio: WhatsApp (Cloud y Web), Telegram, SMS, Line, Messenger, Instagram, correo, widget del sitio, canal de API y grabaciones de llamadas. La configuración es la misma para todos.
Tres decisiones, en este orden:
- Activada o desactivada en la bandeja de entrada. Toda bandeja nueva nace desactivada.
- Qué audio cubre: el que envió el contacto, el que grabó el agente, o ambos.
- Una excepción por conversación, cuando una conversación necesita comportarse distinto al resto de la bandeja.
Requisitos previos
- Una clave de API de OpenAI o Groq disponible para la cuenta. Configúrala en Configuración → Integraciones, o pide al operador de la plataforma que la configure en el servidor.
- Acceso de administrador para configurar la bandeja.
- Acceso a la conversación para crear una excepción puntual.
La propia pantalla indica si existe una clave: aparece una etiqueta Clave configurada o Sin clave en la parte superior de la pestaña. Sin clave, la transcripción no puede generar ningún texto — por eso conviene revisar esa etiqueta antes de activar la función.
Paso a paso
Activarla en la bandeja de entrada
- Abre Configuración → Bandejas de entrada y selecciona la bandeja.
- Abre la pestaña Transcripción de audio.
- Revisa la etiqueta de clave en la parte superior. Si dice Sin clave, usa el enlace para configurar la integración antes de continuar.
- Activa Transcripción de audio.
- Elige el alcance con los dos interruptores de abajo:
- Transcribir los audios recibidos de los contactos — activado por defecto.
- Transcribir los audios grabados por los agentes — desactivado en bandejas nuevas; las bandejas que ya existían vienen con él activado, preservando lo que ya hacían.
Cada interruptor se guarda solo, en el momento en que lo cambias.
Ajustar una conversación puntual
- Abre la conversación y despliega Transcripción de audio en el panel lateral derecho.
- El panel muestra la política actual y qué audios se están transcribiendo ahí.
- Usa Ajustar para esta conversación y elige la política:
- Seguir a la bandeja de entrada — el valor predeterminado.
- Transcribir siempre — se aplica incluso con la transcripción desactivada en la bandeja.
- No transcribir nunca — la desactiva solo en esta conversación.
- Con Transcribir siempre aún puedes definir cada alcance por separado o dejarlo heredando la bandeja.
- Haz clic en Guardar.
Configuración y opciones
| Dónde | Opción | Predeterminado | Qué hace |
|---|---|---|---|
| Bandeja | Transcripción de audio | Desactivada | Interruptor principal de la bandeja. |
| Bandeja | Audios recibidos de los contactos | Activado | Transcribe lo que envió el contacto. |
| Bandeja | Audios grabados por los agentes | Desactivado en bandejas nuevas | Transcribe lo que grabó el agente. Las bandejas que ya existían mantienen lo que hacían: activado. |
| Conversación | Política | Seguir a la bandeja | Excepción puntual, sin tocar la bandeja. |
Una bandeja nueva nace con el audio del agente desactivado a propósito: consume IA para producir un texto que el propio agente acaba de decir. Una bandeja que ya existía sigue transcribiendo el audio del agente, porque era lo que ya hacía — la actualización no desactiva nada por su cuenta. Si no necesitas ese texto, desactiva el interruptor y el consumo se detiene.
Casos de uso
- Atención con mucho audio: el equipo lee el mensaje en segundos y responde por texto.
- Búsqueda en el historial: el texto transcrito entra en la búsqueda, así que un audio antiguo vuelve a ser localizable por lo que se dijo en él.
- Conversación sensible: una conversación puede quedarse en No transcribir nunca aunque la bandeja esté activada.
- Piloto controlado: activa la transcripción solo en la bandeja que quieres evaluar antes de extenderla.
Consejos, límites y buenas prácticas
- El límite por archivo es de 25 MB. Los audios más grandes no se transcriben.
- Formatos admitidos:
flac,m4a,mp3,mp4,mpeg,mpga,oga,ogg,wavywebm. Los formatos antiguos comoamry3gpno se transcriben — la burbuja lo avisa en lugar de quedarse vacía. - El idioma se detecta automáticamente. Cuando la conversación ya tiene un idioma conocido, se usa como pista para mejorar el resultado.
- La transcripción aparece sola, sin recargar la página.
- El texto transcrito también se puede traducir — consulta el artículo de traducción automática al final.
Solución de problemas
La burbuja del audio no muestra ningún texto. Revisa, en este orden: la bandeja tiene Transcripción de audio activada; el alcance que corresponde a la dirección de ese audio está activado; la conversación no está en No transcribir nunca; y la etiqueta en la parte superior de la pestaña dice Clave configurada.
La burbuja muestra un aviso en lugar del texto. El aviso dice exactamente qué pasó:
| Aviso | Qué hacer |
|---|---|
| Este formato de audio no se puede transcribir | El audio llegó en un contenedor que los proveedores no aceptan. Pide el audio de nuevo o convierte el archivo. |
| Necesita una clave de OpenAI o Groq | Configura la integración y usa Intentar de nuevo. |
| El proveedor no respondió | Fallo temporal. Usa Intentar de nuevo. |
| Audio por encima del límite de 25 MB | No se puede transcribir. Pide una grabación más corta. |
| Archivo de audio vacío | El archivo llegó sin contenido. Pide que lo reenvíen. |
El botón "Intentar de nuevo" no aparece. Solo aparece en los casos en que un segundo intento podría funcionar. Un formato no admitido o un archivo demasiado grande fallarían igual.
Estamos pagando IA por audio que no necesitamos. Desactiva Transcribir los audios grabados por los agentes en la bandeja. Es el origen más habitual de consumo que no aporta valor.