Nuestra voz refleja nuestro acento, nuestra edad, nuestro ritmo al hablar y muchas de las pequeñas particularidades que forman parte de nuestra manera de relacionarnos con los demás.
Por eso, cuando una enfermedad, una intervención quirúrgica u otra situación puede afectar al habla, pensar en cómo será la voz de un futuro comunicador también puede convertirse en una decisión importante.
Actualmente existen diferentes tecnologías que permiten preservar, recrear o personalizar una voz para utilizarla en un software de comunicación aumentativa y alternativa (SAAC). Conocerlas con antelación puede ayudar a tomar decisiones con mayor tranquilidad y encontrar la opción que mejor se adapte a cada persona.
¿Qué es una voz personalizada?
Los programas de comunicación suelen incluir diferentes voces sintéticas que permiten leer en voz alta los mensajes que la persona escribe o selecciona en su comunicador. Sin embargo, estas voces predeterminadas no siempre representan su edad, su acento, su idioma o la forma en la que le gustaría sonar.
Las voces personalizadas buscan ofrecer una alternativa más cercana a la identidad y las preferencias de cada persona:
- En algunos casos, la voz se crea a partir de grabaciones realizadas por el propio usuario.
- En otros, puede recrearse utilizando archivos de audio anteriores.
- En ocasiones, también se utiliza la voz de un “donante”, como un familiar, para tener una voz “aproximada” cuando no se disponen de grabaciones ni posibilidad de hacerlas.
Una voz personalizada no tiene por qué ser una reproducción exacta de la voz original. Su objetivo es proporcionar una opción con la que la persona pueda sentirse más identificada al comunicarse.
Banco de voz, banco de mensajes y recreación de voz: ¿son lo mismo?

Aunque estos conceptos están relacionados, no describen exactamente el mismo proceso.
Banco de voz
El banco de voz consiste en grabar un conjunto de frases seleccionado específicamente para recoger los diferentes sonidos y características del habla de una persona. A partir de estas grabaciones, el sistema genera una voz sintética personalizada que posteriormente puede utilizarse para leer cualquier texto escrito en un comunicador.
Esto significa que la persona no está limitada a reproducir las frases que grabó inicialmente. La voz digital puede utilizarse para construir y expresar mensajes nuevos.
Siempre que sea posible, es recomendable realizar este proceso antes de que la voz haya experimentado cambios significativos. No obstante, cada situación debe valorarse individualmente y las sesiones pueden adaptarse a la energía y las necesidades de la persona.
Banco de mensajes
El banco de mensajes consiste en grabar previamente palabras, frases o expresiones importantes con la voz natural de la persona. Pueden ser mensajes cotidianos, como una forma particular de saludar, pero también expresiones con un significado emocional especial: una broma familiar, una frase de cariño, una canción o una manera concreta de llamar a alguien.
A diferencia de la banca de voz, estas grabaciones no permiten construir frases nuevas. Se reproducen exactamente tal y como fueron grabadas, conservando su entonación, emoción e intención originales.
El banco de mensajes y el banco de voz no son opciones excluyentes. Pueden utilizarse conjuntamente: la voz sintética permite construir cualquier mensaje, mientras que las grabaciones personales ayudan a conservar determinadas expresiones con la voz y la entonación originales.
Recreación o clonación de voz mediante inteligencia artificial
Las nuevas herramientas de inteligencia artificial (IA) también permiten crear voces digitales a partir de muestras de audio. Dependiendo de la tecnología utilizada, estas muestras pueden proceder de grabaciones realizadas específicamente para crear la voz o de archivos ya existentes, como notas de voz y vídeos.
La cantidad y la calidad del material necesario varían según la solución. Algunas herramientas permiten obtener un primer resultado con muestras breves, mientras que los procesos más avanzados necesitan grabaciones más extensas.
¿Cuándo puede ser útil plantearse una voz personalizada?
Las voces personalizadas pueden resultar especialmente relevantes cuando existe la posibilidad de que el habla cambie o se pierda como consecuencia de:
- Una enfermedad neurodegenerativa.
- Una intervención o tratamiento que pueda afectar a la voz.
- Una enfermedad neuromuscular.
- Una lesión o daño adquirido que dificulte el habla.
- Una situación progresiva en la que se prevea la necesidad futura de utilizar comunicación aumentativa.
También pueden ser una opción para personas que ya utilizan un comunicador y desean encontrar una voz más acorde con su edad, su idioma, su identidad o sus preferencias.
6 aspectos que conviene tener en cuenta
Antes de comenzar un proceso de creación o elección de una voz personalizada, conviene valorar diferentes aspectos.
1. El momento en el que se encuentra la persona
Si todavía es posible hablar con cierta comodidad, puede plantearse una grabación guiada. Cuando existe fatiga, las sesiones pueden dividirse y adaptarse.
Si la voz ya ha cambiado o no es posible completar nuevas grabaciones, habrá que estudiar el material anterior disponible y valorar otras alternativas.
2. La calidad y cantidad de las grabaciones
Una habitación silenciosa, un micrófono adecuado y unas condiciones de grabación estables pueden mejorar considerablemente el resultado.
Cuando se utilizan audios antiguos, también es importante comprobar que la voz se escuche con claridad y que no haya música, ruido u otras personas hablando al mismo tiempo.
3. El comunicador o software que se utilizará
No todas las voces son compatibles con todos los dispositivos, sistemas operativos y programas de comunicación.
Antes de iniciar el proceso, conviene comprobar dónde podrá instalarse o utilizarse la voz, cómo se conectará con el software y si será posible trasladarla a otro dispositivo en el futuro.
4. La necesidad de conexión a internet
Algunas voces se instalan directamente en el comunicador y pueden utilizarse sin conexión. Otras funcionan mediante servicios en la nube y necesitan enviar el texto a servidores externos para generar el audio.
Esta diferencia puede afectar a la velocidad de la generación del audio de cada mensaje, a la disponibilidad de la voz fuera de casa y a su funcionamiento en lugares con una conexión inestable.
5. Los idiomas y acentos disponibles
La disponibilidad de idiomas, acentos y variantes depende de cada proveedor. Este aspecto puede resultar especialmente importante para las personas que utilizan habitualmente más de un idioma.
6. El tipo de licencia y su continuidad
Algunos servicios ofrecen licencias de pago único, mientras que otros funcionan mediante suscripciones o requieren una cuenta activa.
Además del coste inicial, conviene valorar qué ocurrirá si se cambia de dispositivo, si será necesario renovar la licencia y qué funciones estarán disponibles a largo plazo.

Herramientas para crear una voz personalizada
Actualmente existen diferentes herramientas que permiten crear o recrear una voz personalizada para utilizarla en un comunicador. Algunas se basan en un proceso de banca de voz guiado, mientras que otras utilizan inteligencia artificial para generar una voz a partir de muestras de audio.
Entre las soluciones disponibles se encuentran Acapela My Own Voice, creada específicamente para preservar la voz mediante grabaciones realizadas por la propia persona, y ElevenLabs, una herramienta de inteligencia artificial que permite recrear voces a partir de audios nuevos o ya existentes.
Acapela My Own Voice
Acapela My Own Voice es un servicio de banca de voz diseñado para crear una voz sintética personalizada mediante un proceso de grabación guiado. A partir de las frases grabadas por la persona, el sistema genera una voz que puede utilizarse para leer los mensajes escritos en un comunicador. Una vez adquirida e instalada en un dispositivo compatible, puede utilizarse sin depender permanentemente de una conexión a internet y con privacidad de los datos registrados.
ElevenLabs
ElevenLabs es una herramienta de inteligencia artificial que permite recrear una voz a partir de diferentes muestras de audio, ya sean grabaciones realizadas específicamente para el proceso o archivos anteriores, como notas de voz o vídeos. Las voces creadas con ElevenLabs pueden utilizarse en Grid 3 y Grid for iPad mediante una cuenta y una clave de acceso.
Cada herramienta tiene unas características, requisitos y posibilidades diferentes. Por eso, antes de comenzar el proceso, es importante valorar el momento en el que se encuentra la persona, las grabaciones disponibles y el comunicador o software que utilizará.

Te acompañamos en el proceso
Sabemos que valorar estas tecnologías puede generar muchas preguntas: cuándo empezar, qué grabaciones se necesitan, qué voz será compatible con el comunicador o qué diferencias existen entre las distintas soluciones.
En Qinera podemos ayudarte a conocer las posibilidades disponibles y a valorar cuál puede adaptarse mejor a las necesidades, preferencias y circunstancias de cada persona.
Porque lo verdaderamente importante no es únicamente disponer de una voz, sino contar con una forma de comunicación que permita seguir expresándose, participando y compartiendo con los demás.
¿Quieres conocer las diferentes opciones de voces personalizadas? Contacta con nuestro equipo y te ayudaremos a valorar cuál puede adaptarse mejor a tu situación.
