Firefly abre voz, efectos y música: tres herramientas salen de la beta

Adobe llevó Generate Music, Generate Speech y Generate Sound Effects a disponibilidad general en Firefly el 20 de agosto de 2026. El anuncio de Adobe confirma que las tres funciones ya están disponibles ampliamente en su estudio creativo web y las vincula, respectivamente, con Firefly Music Model, Firefly Speech Model —con ElevenLabs como opción— y Firefly Audio Model.
Desde el 20 de agosto, Firefly puede generar música instrumental, convertir guiones en locuciones y crear efectos ajustados a una acción o un momento del contenido. La salida de beta amplía su disponibilidad, pero no garantiza que cada resultado esté terminado: Adobe presenta el audio como apto para producción y uso comercial, mientras que una prueba independiente encontró una calidad generalmente útil, con fricciones de interfaz y generaciones que exigieron ajustes.
Qué cambia con la disponibilidad general

El cambio confirmado es el estatus de las herramientas dentro de Firefly. Generate Music, Generate Speech y Generate Sound Effects dejan de ser funciones en beta y pasan a la oferta de acceso general; esto no debe confundirse con Generate Music dentro de Premiere, que seguía identificado como beta en el anuncio correspondiente a esa aplicación.
Las tres cubren partes distintas de una producción audiovisual. Music crea una pista instrumental continua; Speech transforma texto en voz; Sound Effects genera sonidos puntuales o ambientes relacionados con la acción, el ritmo o la energía de una pieza. No son variantes de un mismo generador ni sustituyen indistintamente las tareas de las otras dos.
Ficha comparativa: entrada, salida y controles

- Generate Music. Recibe una descripción escrita o un vídeo. Al analizar imágenes puede sugerir etiquetas editables para orientar ambiente, estilo y propósito; el usuario también controla energía, tempo y duración. Produce varias pistas instrumentales y permite descargar el audio como WAV o unido al vídeo. La duración admitida va de cinco segundos a cinco minutos, y Adobe aclara que la función no genera voces ni letras.
- Generate Speech. Parte de un guion y entrega una locución. Permite escoger el modelo de voz, el hablante y el idioma, además de modificar emoción, ritmo, énfasis, pronunciación y pausas en fragmentos del texto. Firefly Speech Model es la opción propia de Adobe y ElevenLabs aparece como modelo asociado. Los materiales consultados para este lanzamiento no fijan una duración máxima común para ambos.
- Generate Sound Effects. Parte de una descripción del sonido y crea efectos o ambientes para acompañar una acción. El resultado puede colocarse sobre una línea de tiempo, desplazarse, superponerse con otras pistas y ajustarse en volumen. Está orientado a sonidos concretos y capas ambientales, no a componer música ni producir habla.
La diferencia práctica está en la relación entre entrada y salida. Music interpreta el tono general de una pieza y sostiene su duración; Speech representa un texto mediante una voz seleccionada; Sound Effects resuelve acontecimientos sonoros localizados. Para valorar si una generación sirve, primero hay que compararla con la tarea específica de su herramienta.
Lo que Adobe declara sobre licencia y acceso gratuito

La declaración comercial más detallada corresponde a Generate Music. La ficha oficial de Generate Music califica las pistas como libres de regalías, plenamente licenciadas y aptas para proyectos comerciales; también indica que Adobe no reclama su propiedad y que les aplica Content Credentials para registrar su origen mediante IA.
La misma ficha permite usar el generador con una cuenta gratuita y habla de generaciones diarias sin costo, pero no publica una cantidad diaria fija. El acceso gratuito debe entenderse, por tanto, como limitado; los planes de pago ofrecen mayor volumen y más opciones de modelos.
Para el conjunto de las tres herramientas, Adobe utiliza la expresión “comercialmente seguro” y las presenta como audio preparado para trabajos terminados. Sin embargo, el anuncio no desglosa en el mismo nivel las condiciones aplicables a cada opción de modelo dentro de Speech. La declaración comercial de Adobe tampoco elimina las reglas de una plataforma de distribución, un encargo o un contrato; el alcance específico de la licencia en vídeos monetizados requiere distinguir esos niveles.
La prueba independiente: Music sobresale, pero exige dirección
La prueba publicada por TechRadar empleó un vídeo de 27 segundos para Music y otro de 12 segundos para Sound Effects; en las generaciones descritas, Firefly entregó cuatro variantes, y el autor consideró Generate Music la función más convincente de las tres.
Las primeras pistas musicales le parecieron genéricas, aunque utilizables, y mejoraron cuando añadió indicaciones de estilo, finalidad y energía. Esto muestra una limitación concreta de la prueba: la calidad dependió de la dirección introducida y no puede atribuirse únicamente a la selección automática basada en el vídeo.
Generate Speech produjo una locución menos mecánica que los antiguos lectores de texto, pero fue necesario corregir pausas y una palabra quedó mal pronunciada. La previsualización también añadió fricción: había que seleccionar el pasaje y abrir un menú contextual en lugar de reproducirlo directamente desde un control visible.
En Sound Effects, una solicitud de silbido generó variantes descritas como estridentes, mientras que una petición posterior de grillos resultó más aprovechable. La parte mejor valorada fue la edición en la línea de tiempo, donde podían combinarse pistas, moverlas y cambiar su volumen. Son observaciones de una experiencia individual, no una medición sistemática entre idiomas, voces, estilos musicales o categorías de efectos.
Disponibles para trabajar, sin garantía de primera toma
El estado confirmado desde el 20 de agosto de 2026 es claro: las tres funciones salieron de beta en Firefly y están disponibles de forma general. Generate Music reúne la declaración comercial más específica y fue la herramienta mejor valorada en la prueba independiente; Speech y Sound Effects también produjeron material aprovechable, aunque mostraron problemas de pronunciación, previsualización y consistencia entre instrucciones.
La disponibilidad general significa que Adobe incorporó estas funciones a su oferta estable en Firefly, no que toda primera generación pueda entregarse sin revisión. Siguen faltando evaluaciones amplias y comparables sobre rendimiento entre idiomas, tipos de voz, géneros musicales y clases de efectos; por ahora, la evidencia publicada permite hablar de herramientas operativas, pero no de resultados uniformes.
Lee también:
Suscríbete a nuestro boletín
Reciba las últimas noticias sobre Web3, IA y criptomonedas directamente en su bandeja de entrada.