Sesión 5 · Tu Voz con IA (ElevenLabs)
Habilidades Prácticas con IA · Parte 2 · Sesión 5 de 8

Tu Voz
con IA

Hoy empieza la Parte 2: dejamos de usar la IA para empezar a producir con ella. Primera parada: convierte cualquier texto en audio con tu propia voz, de forma ética y profesional.

⏱️ 2 horas 🎯 Metodología 30 / 70 🧩 Nivel Continuación
🎙️ ElevenLabs 💬 ChatGPT 📁 Google Drive

Trabajamos con el plan gratuito de ElevenLabs (texto a voz). Clonar tu propia voz es opcional y usa el icono ⭐ Plus: el plan Starter (~5 USD/mes) lo justifica.

Qué haremos hoy

Agenda de la sesión

🔊

1 · Fundamentos de la voz

Qué es el texto a voz (TTS) y cómo ajustar tono, ritmo y emoción.

≈ 30 min

🧬

2 · Clonación responsable

Cómo clonar tu propia voz con consentimiento, y cómo protegerte de estafas, phishing y vídeos falsos.

≈ 50 min

🎧

3 · Narración y doblaje

Narra tus apuntes, dobla contenidos y usa varias voces a la vez.

≈ 30 min

🎁
Tu entregable de hoy

Un audio narrado con tu propia voz (un resumen de estudio, la intro de un contenido o el material que traigas), guardado y listo para compartir.

🚀 Empieza la Parte 2

De usar la IA a producir con ella

🧠

Sesiones 1-4 · Parte 1

Aprendiste a preguntar bien, verificar datos, escribir con tu voz y crear documentos, imágenes y vídeo.

🎙️

Sesiones 5-8 · Parte 2

Ahora construyes activos propios: una voz digital, un asistente, una automatización y una web publicada.

🏁 El hilo de hoy: cada sesión de la Parte 2 te deja algo tuyo y reutilizable. Empezamos por lo más personal: tu voz.
El mapa de hoy

¿Quién hace qué?

🎙️ ElevenLabs

La protagonista: texto a voz, clonación de tu voz, narración y doblaje.

💬 ChatGPT

Escribe el guion que vas a narrar: limpio, con pausas y sin relleno.

📁 Google Drive

Donde guardas tus audios para reescucharlos o compartirlos.

🎧 Tus auriculares

Para grabar tu muestra de voz sin ruido, si vas a clonarla.

⭐ Free-first: todo lo de hoy funciona con la cuenta gratuita de ElevenLabs. Solo la clonación de tu voz necesita el plan Starter (~5 USD/mes).
Antes de abrir tu primer recurso

Cómo leer un fichero Markdown (.md)

Todos los recursos de la carpeta de Drive (prompts, guías, checklists) están en un formato de texto simple llamado Markdown. Ábrelo tal cual — no necesitas instalar nada.

# Título

Un título grande. Con ## es un subtítulo.

**negrita**

Texto en negrita.

- Un ítem

Una lista con viñetas. Con 1. sería numerada.

`código`

Texto con formato de código (un comando, un dato exacto).

> Una nota

Una cita o nota destacada.

```texto```

Un bloque completo — normalmente, un prompt listo para copiar.

💡 Truco: los símbolos # * ` son solo marcas de formato — ignóralos al leer, la frase de al lado ya te dice qué significan. No hace falta ningún programa especial.
Tema 1 de 3

Cualquier texto, en voz humana

Escribe o pega un texto y en segundos tienes un audio natural, con el tono y el ritmo que tú decides.

La base de todo

Qué es el texto a voz (TTS)

⌨️

Escribes o pegas texto

Un resumen, un guion, un párrafo de un documento tuyo.

🗣️

Eliges una voz

De la biblioteca de ElevenLabs (decenas de voces gratis) o la tuya clonada.

⚙️

Ajustas cómo suena

Tono, ritmo y expresividad, con unos controles muy simples.

💾

Generas y descargas

Un archivo .mp3 listo en segundos, sin grabar nada.

🎯 La idea: no necesitas saber nada de audio. Es tan simple como escribir en un chat, pero el resultado es sonido.
Sin clonar nada

Empieza con voces de la biblioteca

Antes de pensar en clonar tu propia voz, ElevenLabs ya trae decenas de voces gratuitas, en español y otros idiomas, listas para usar.

🌎

Acentos variados

Voces de España y de distintos países de Latinoamérica.

🎭

Estilos distintos

Narrativa, conversacional, informativa… prueba varias y compara.

🆓

100% gratis

Suficiente para narrar apuntes, resúmenes o la intro de un vídeo.

💡 Para hoy: si no quieres clonar tu voz, el Ejercicio 1 y el entregable funcionan igual con una voz de la biblioteca.
3 controles, muchísimo cambio

Ajusta tono, ritmo y emoción

1
Estabilidad: más baja = más expresiva y variable; más alta = más uniforme y predecible.
2
Similitud: cuánto se ciñe la voz generada al timbre original de la voz elegida.
3
Estilo / velocidad: cuánta expresividad añade y a qué ritmo habla.
⭐ No hay ajuste "correcto": genera el mismo texto un par de veces cambiando un control cada vez y quédate con lo que suene más natural para tu caso.
Casos reales, no un juguete

¿Para qué te sirve narrar con IA?

🎓

Estudiar escuchando

Convierte tus apuntes o el "set de estudio" de la Sesión 1 en audio para repasar caminando o en el bus.

Accesibilidad

Hace tu contenido accesible a quien prefiere escuchar, tiene dificultad de lectura o baja visión.

📢

Publicar más rápido

La intro de un vídeo, un podcast corto, un mensaje institucional: sin cámara ni micrófono.

🌍

Llegar a más idiomas

El modelo multilingüe narra el mismo texto en decenas de idiomas manteniendo el timbre.

🔗 Conecta con la Parte 1: el texto lo puedes escribir tú, o pedírselo a ChatGPT con tu voz (Sesión 2). ElevenLabs solo le pone el sonido.
Demostración · sigue los pasos

Demo: tu primer audio con ElevenLabs

Guion en ChatGPT → texto a voz en ElevenLabs. Avanza paso a paso.

💬 ChatGPT → 🎙️ ElevenLabs
Paso 1 · Pide el guion
En ChatGPT: "Resume estos apuntes en un guion de audio de 1 minuto, frases cortas y pausas naturales, para narrarlo con IA."
IA
Guion listo
Un texto corto, con frases cortas y comas donde conviene una pausa. Listo para copiar.
Paso 2 · Pégalo en ElevenLabs
Abro Text to Speech, pego el guion y elijo una voz de la biblioteca en español.
Paso 3 · Ajusta y genera
Bajo un poco la estabilidad para que suene más natural y pulso Generate.
IA
Audio generado
🔊 Un .mp3 de ~1 minuto con voz natural, listo para escuchar y descargar.
🎧 Escúchalo antes de darlo por bueno: a veces un nombre propio o una sigla suena raro. Ajusta la escritura (fonética) y regenera esa frase.
El último paso, el que se olvida

Dónde guardar y compartir tus audios

📁

Google Drive

Súbelo a la misma carpeta del curso; así queda junto a tus otros entregables.

💬

WhatsApp

Como nota de voz o archivo adjunto, para compartirlo rápido con alguien.

🎬

Dentro de un vídeo

Impórtalo como pista de audio en CapCut o Canva (Sesión 4).

📌 Hábito simple: nombra el archivo con el tema y la fecha (voz_repaso-examen_15-06.mp3) para encontrarlo luego.
Práctica guiada · 15 min · 70%

🛠️ Ejercicio 1: genera tu primer audio

Pasos

1
Elige un texto corto: un resumen, tus apuntes o el que traigas.
2
Pídele a ChatGPT un guion narrable de ~1 minuto.
3
Pégalo en ElevenLabs y elige una voz de la biblioteca.
4
Ajusta la estabilidad, genera y guarda el .mp3.

Tu checklist

Resume este texto en un guion de audio de [1] minuto,
con frases cortas y pausas naturales, para narrarlo con una IA de voz.
Texto: [pega aquí]
📎 Recurso: recursos/prompts.md · recursos/guia-elevenlabs.md
Tema 2 de 3

¿Y si la voz fuera la tuya?

Con unos minutos de audio propio, ElevenLabs puede narrar con tu timbre de voz. Veamos cómo hacerlo bien — y con permiso.

Dos niveles

Qué es clonar tu voz

Clonación instantánea

Con 1-2 minutos de audio limpio, ElevenLabs genera una voz parecida a la tuya en segundos.

🎯

Clonación profesional

Con 30+ minutos de audio, el resultado es prácticamente indistinguible. Para uso más exigente.

👉 Para hoy: nos quedamos con la clonación instantánea — rápida, suficiente para practicar y para la mayoría de tus usos.
Antes de clonar nada · lo no negociable

Clona con criterio

✅ Buen uso
  • Clonas tu propia voz, con tu consentimiento
  • Avisas cuando un audio está generado con IA
  • Pides permiso explícito si clonas a otra persona
⛔ Evita
🚫 Clonar la voz de alguien sin su permiso
🚫 Hacer pasar un audio de IA por una grabación real
🚫 Usar una voz clonada para suplantar o engañar
🌱 La regla de siempre: el humano piensa, la máquina ayuda. Tu voz es tuya: decides tú cuándo y cómo se usa.
Cómo se detecta el audio con IA

Marca de agua y transparencia

🔍

Marca de agua inaudible

Todo audio generado en ElevenLabs lleva una marca digital para poder identificarse como IA.

🛡️

Detector de voz IA

Herramientas como el AI Speech Classifier de ElevenLabs comprueban si un audio fue generado con IA.

🛡️ Por qué importa: saber que existe esta trazabilidad es una razón más para usar la clonación con responsabilidad, no para "que no se note".
Seguridad digital · caso 1: la voz

El lado oscuro: estafas con voz clonada

La misma tecnología de hoy ya se usa para estafar. En Colombia es un fraude en aumento: te llaman con la voz clonada de un familiar pidiendo dinero urgente.

📞 Así funciona la estafa: alguien clona la voz de tu papá, tu mamá o un ser querido (a veces con audios sacados de redes sociales) y te llama fingiendo una emergencia: "necesito dinero ya". Al reconocer la voz, la víctima confía y transfiere el dinero — y era una IA.

Cómo protegerte y proteger a tu familia

1
Cuelga y llama tú: vuelve a marcar el número real de esa persona, nunca confíes en el número que te llamó.
2
Pon una palabra clave familiar: una palabra que solo tu familia conozca, para verificar identidad en una emergencia real.
3
Desconfía de la urgencia: quien estafa presiona para que actúes sin pensar. Tómate el tiempo de verificar.
4
Verifica por otro canal: un mensaje de texto o una videollamada a esa persona antes de mandar nada.
🌱 Tu responsabilidad hoy: ya sabes cómo se hace esto. Cuéntaselo a tu familia — sobre todo a quien tenga menos costumbre con la tecnología. Es la mejor vacuna contra esta estafa.
Seguridad digital · caso 2: el mensaje

Phishing potenciado por IA

El phishing (mensajes o correos que suplantan a alguien de confianza para robarte datos o dinero) existe desde hace años. Lo nuevo es que la IA lo hace mucho más creíble.

✍️

Sin errores

Antes se detectaba por la mala ortografía. Ahora la IA escribe perfecto, en tu idioma y con tu acento.

🎯

Personalizado

Con datos de tus redes sociales, arma un mensaje que parece escrito solo para ti — tu jefe, tu profesor, tu banco.

⏱️

Con presión

"Tu cuenta será bloqueada", "acción requerida ya" — el mismo truco de la urgencia que vimos con la voz clonada.

🚩 Señales de alerta: te pide datos, contraseñas o dinero con urgencia · el remitente no es del todo el habitual (revisa el correo/número completo, no solo el nombre) · un enlace acortado o raro · algo que "no suena" a cómo esa persona te habla normalmente.
Seguridad digital · caso 3: la imagen

Cuando te clonan en vídeo (deepfakes)

Lo mismo que hoy hicimos con la voz ya existe para el vídeo: con unas pocas fotos o segundos tuyos, una IA puede generar un vídeo de ti diciendo o haciendo algo que nunca pasó.

🎭

Se hacen pasar por ti (o por otro)

Un vídeo falso de tu jefe, un familiar o una autoridad, pidiéndote dinero o una acción urgente en una videollamada o mensaje.

⚠️

Te muestran haciendo algo falso

Crean un vídeo donde apareces tú diciendo o haciendo algo que no hiciste, para difamarte, acosarte o extorsionarte.

🔍 Cómo sospechar: parpadeo raro o ausente, voz ligeramente desincronizada con los labios, iluminación o sombras que no cuadran, y — otra vez — un contexto de urgencia o presión.
Seguridad digital · tu plan de reacción

Qué hacer si te pasa a ti

Sirve igual para una voz clonada, un mensaje de phishing o un vídeo falso: el orden importa más que la velocidad.

1
No actúes bajo presión: respira. Nadie de confianza te exige decidir en 30 segundos.
2
Verifica por otro canal: llama, escribe o visita a esa persona por una vía que tú controlas, no la que te ofrece el mensaje.
3
Guarda evidencia: captura de pantalla, el audio, el vídeo o el mensaje — te va a hacer falta para denunciar.
4
Repórtalo: a la plataforma donde ocurrió (todas tienen botón de reporte) y a la Policía Nacional, que en Colombia tiene canales específicos para delitos informáticos.
5
Avisa a tu entorno: familia, compañeros, estudiantes. Contarlo es la mejor forma de que no le pase a alguien cercano.
🌱 El mantra, aplicado aquí: el humano piensa, la máquina ayuda — y pensar antes de reaccionar es, hoy, tu mejor defensa.
📎 Recurso: resumen imprimible en recursos/alerta-estafas-ia.md
5 minutos de preparación

Cómo grabar una buena muestra de voz

1
Lugar silencioso: sin eco ni ruido de fondo (una habitación con tela o cortinas ayuda).
2
1-2 minutos: lee un texto neutro en voz clara y a tu ritmo natural.
3
Sin música ni voces de fondo, y sin exagerar el tono.
4
Graba con el micrófono del móvil o del portátil: es suficiente para la clonación instantánea.
📝 Texto de lectura: tienes uno listo, neutro y de la duración justa, en recursos/guia-elevenlabs.md.
Demostración · sigue los pasos

Demo: clona tu voz paso a paso

De la muestra grabada a tu primera narración con tu propia voz.

🎙️ ElevenLabs · Voices
Paso 1 · Sube tu muestra
Dans Voices → Add Voice → Instant Voice Cloning, subo mi grabación de 1-2 minutos.
Paso 2 · Confirma el consentimiento
Marco la casilla: es mi propia voz y autorizo su uso. Le pongo un nombre: "Mi voz".
IA
Voz clonada
🎙️ Ya tienes una voz nueva en tu biblioteca, lista para usar en Text to Speech.
Paso 3 · Narra con tu voz
Vuelvo a Text to Speech, elijo "Mi voz" y pego el mismo guion de antes.
IA
Audio con tu voz
🔊 El mismo texto, ahora narrado con tu timbre de voz.
🎧 Compara: escucha el audio de la biblioteca y el de tu voz clonada, uno detrás del otro. La diferencia es notable.
Práctica guiada · 15 min · 70%

🛠️ Ejercicio 2: clona tu voz (o elige una)

Pasos

1
Si tienes plan Starter: graba tu muestra y clónala. Si no, elige otra voz de la biblioteca.
2
Confirma el consentimiento (es tu voz, la usas tú).
3
Genera el mismo guion del Ejercicio 1 con esta voz.
4
Escucha y compara los dos audios.

Tu checklist

📎 Recurso: texto de lectura y pasos en recursos/guia-elevenlabs.md
Tema 3 de 3

De un audio a un hábito

Narra tus apuntes, dobla contenidos a otro idioma y combina varias voces. Así se convierte en parte de cómo estudias y publicas.

El paso que marca la diferencia

Escribe el guion antes de narrar

Pegar un texto tal cual (con enlaces, siglas o frases larguísimas) suena raro. Un buen guion se prepara en segundos con ChatGPT.

Convierte este texto en un guion para narrar en audio: frases cortas,
sin enlaces ni símbolos raros, con pausas marcadas por comas y puntos.
Duración objetivo: [1-2] minutos.
Texto: [pega aquí]
🔗 Conecta con la Sesión 2: pide también que respete tu voz (Sesión 2) para que el audio no suene genérico.
La aplicación estrella para estudiantes

Narra tus apuntes para estudiar

📝

Tu set de estudio (S1)

El resumen que creaste en la Sesión 1, ahora en audio para repasar sin pantalla.

🚶

Repaso en movimiento

Escúchalo caminando, en el bus o haciendo ejercicio: tiempo que antes se perdía.

🔁

Repetición espaciada

Genera versiones cortas de 1 minuto por tema y repásalas varias veces por semana.

🎓 Para docentes: lo mismo sirve para dejar un resumen narrado de una clase a tu alumnado.
Un paso más allá del TTS

Doblaje y voces múltiples

🌐

Dubbing (doblaje)

Sube un audio o vídeo y ElevenLabs lo traduce y narra en otro idioma, conservando el timbre.

👥

Varias voces en un audio

Asigna una voz distinta a cada "personaje" para diálogos o entrevistas simuladas.

💡 Idea de uso: dobla un vídeo tuyo de la Sesión 4 a inglés, o crea un "diálogo" de preguntas y respuestas para repasar un tema.
Por si te falta inspiración

Ideas según tu perfil

🎓

Estudiante

Narra un resumen de examen y llévalo contigo toda la semana de repaso.

🧑‍🏫

Docente

Deja un audio-resumen de cada unidad, o dobla un vídeo educativo a otro idioma.

💼

Administrativo

Narra un aviso o instructivo interno para quien prefiere escuchar a leer.

❤️

Algo tuyo

La intro en audio de un proyecto personal, un podcast propio o un mensaje especial.

Tu entregable de hoy · 15 min · 70%

🎁 Tu audio narrado con tu propia voz

Qué debe incluir

  • Un guion narrable de al menos 1 minuto
  • Generado con tu voz (clonada) o una de la biblioteca
  • Revisado a la escucha, sin frases raras
  • Guardado en tu Drive con un nombre claro

Checklist de entrega

📎 Recurso: recursos/ejercicio-guiado.md
Comprueba lo aprendido · 2 preguntas
1️⃣ Para clonar tu propia voz en ElevenLabs de forma responsable, lo imprescindible es…
✅ ¡Exacto! Clonas tu propia voz (o la de alguien que te dio permiso) y confirmas el consentimiento.
🤔 Lo esencial es el consentimiento: tu voz o la de alguien que lo autorizó explícitamente.
2️⃣ ¿Qué control de ElevenLabs bajas para que la voz suene más expresiva y natural?
✅ ¡Eso es! Una estabilidad más baja da más variación y naturalidad a la voz.
🤔 Es la estabilidad: más baja = más expresiva; más alta = más uniforme.
Entre la Sesión 5 y la 6 · elige al menos uno

📺 Para ver o pensar antes de la próxima sesión

🎧

Practica

Narra un segundo audio con un texto distinto: un tema de trabajo, una noticia o un mensaje que quieras enviar.

🤔

Reflexiona

Piensa en una tarea repetitiva tuya (contestar siempre lo mismo, explicar siempre lo mismo): la usaremos en la Sesión 6.

📝
Micro-tarea (5 min) para traer a la Sesión 6

Trae identificada una pregunta o tarea que repites a menudo (a estudiantes, a compañeros, a ti mismo): sobre eso construiremos tu asistente personal.

Resumen y siguiente sesión

Lo que te llevas hoy

🔊

TTS sin esfuerzo

Cualquier texto, convertido en audio natural en segundos.

🧬

Tu voz, con permiso

Clonación responsable: siempre tu voz o con consentimiento explícito.

🎧

Un hábito nuevo

Narrar apuntes y contenidos, parte de cómo estudias y publicas.

⚠️ Errores comunes a evitar: pegar el texto sin prepararlo · clonar una voz sin permiso · no escuchar el resultado antes de compartirlo.
🌱 Y el mantra del programa: el humano piensa, la máquina ayuda. Tu voz, tus palabras, tu criterio.
➡️
Próxima sesión: Crea tu Asistente Personal de IA

Configurarás un asistente con tu propio conocimiento y personalidad. Trae la tarea/pregunta que repites a menudo.