Como Traduzir um Vídeo (som & subtitles) com Claude Code ou Codex
Utilizo principalmente a IA para os meus projetos de tradução. Encontram-se muitos vídeos chineses no YouTube, TikTok ou Facebook que não oferecem legendas automáticas nem tradução automática.
Como quero compreendê-los, criei um projeto capaz de automatizar grande parte do processo: transcrever o vídeo, traduzir as legendas e, se necessário, ir até à dobragem automática em francês.
A partir desta mesma base, também é possível criar automaticamente clippings, ou seja, excertos curtos do vídeo.
Neste artigo, utilizo como exemplo a tradução chinês → francês. Mas o princípio pode ser adaptado a praticamente todas as línguas. Encorajo-o vivamente a utilizar Claude Code ou Codex CLI – em linha de comando.
Porquê utilizar a transcrição em vez do OCR?
Os vídeos chineses têm frequentemente legendas chinesas diretamente incrustadas na imagem. Poderíamos, portanto, utilizar OCR (reconhecimento de texto numa imagem) para recuperar essas legendas.
Após várias tentativas, percebi, no entanto, que este método era bastante longo e complicado. Afinal, é mais simples partir diretamente da fala presente no vídeo e transformá-la em texto através de um sistema de transcrição automática, chamado ASR (Automatic Speech Recognition).
O princípio é, portanto, bastante simples:
Vídeo → transcrição chinesa → correção → tradução francesa → legendas francesas → eventualmente dobragem
Preparar o skill
Para automatizar este processo, recomendo preparar antecipadamente alguns ficheiros de referência no skill. Eles contêm as regras que os agentes devem respeitar. Isto permite modificar facilmente o comportamento do sistema sem ter de reescrever todo o workflow.
references/
├── translation_rules.md # regras de tradução
├── glossary_zh_fr.md # nomes próprios e termos recorrentes
├── formatting_rules.md # regras de apresentação das legendas
└── quality_check.md # controlos de qualidade
Estes ficheiros podem ser preparados com a ajuda da IA. Aconselho simplesmente a pedir-lhe que proponha várias variantes ou alguns exemplos de tradução, e depois escolher o tom e as regras que lhe convêm.
Para evitar sobrecarregar a sessão principal com o texto de todo o vídeo, o workflow pode depois utilizar agentes autónomos. Cada agente recebe apenas as informações e os ficheiros de referência de que precisa. Por exemplo, um agente pode ocupar-se da transcrição, outro da tradução e outro do controlo de qualidade. A sessão principal serve sobretudo para orquestrar as diferentes etapas.
O processo completo
1. Transformar a fala chinesa em legendas
Começa-se por recuperar o vídeo original. Para o YouTube, Facebook ou TikTok, pode utilizar-se yt-dlp.
Utiliza-se depois um sistema de reconhecimento de voz (ASR) para transformar a fala chinesa em texto. O resultado é um ficheiro de legendas .srt contendo o texto chinês e os horários de início e fim de cada segmento.
Pode utilizar-se, entre outros:
- faster-whisper (medium)
- Qwen3-ASR ForcedAligner
Para o chinês, prefiro Qwen3-ASR. Permite, nomeadamente, fornecer contexto antes da transcrição, o que pode ajudar o modelo a escolher o caractere correto quando várias palavras têm a mesma pronúncia.
Se depois pretende fazer dobragem ou clipes, ative também amarcação temporal ao nível das palavras. Assim terá um alinhamento muito mais preciso entre o texto e a voz.
2. Recuperar os trechos que não foram transcritos
Uma transcrição automática nem sempre é perfeita. A presença de música, por exemplo, pode perturbar o ASR. O sistema pode por vezes considerar um trecho como música ou canto e não transcrever corretamente a fala.
Para identificar estes problemas, pode-se procurar no ficheiro SRT os intervalos anormalmente longos entre dois subtítulos.
Para cada trecho em falta:
- recupera-se o trecho correspondente com ffmpeg ;
- ouve-se novamente;
- relança-se uma transcrição apenas sobre esse trecho.
Isto permite completar a transcrição sem ter de reprocessar todo o vídeo.
3. Corrigir a transcrição chinesa
O ASR pode cometer erros, sobretudo com os homófonos : o modelo reconhece corretamente o som, mas escolhe o caractere ou a palavra chinesa errada.
Relê-se então os trechos suspeitos e corrige-se a transcrição antes de começar a tradução.
Uma má transcrição origina geralmente uma má tradução. Esta etapa merece, por isso, uma atenção especial.
4. Traduzir do chinês para francês
Depois de corrigida a transcrição chinesa, esta é dividida em segmentos. Os segmentos são depois tratados por um agente autónomo especializado em tradução.
O agente consulta nomeadamente os ficheiros de referência do skill para respeitar as regras definidas previamente:
- nível de língua e registo;
- francês natural em vez de tradução palavra a palavra;
- tradução dos nomes próprios;
- termos recorrentes do glossário;
- regras específicas dos diálogos.
As traduções são depois reunidas, mantendo as marcações temporais do ficheiro chinês. Para vídeos longos, é preferível trabalhar um segmento de cada vez. Os agentes autónomos podem assim processar o texto sem saturar o contexto da sessão principal.
5. Verificar e limpar a tradução
Depois de concluída a tradução, realizam-se vários controlos automáticos:
- não deve restar nenhum caráter chinês no ficheiro francês;
- o formato SRT deve ser válido;
- os horários devem ser coerentes;
- o registo deve manter-se homogéneo;
- a tradução deve manter-se coerente do início ao fim.
Outro agente pode depois fazer uma revisão crítica chinês ↔ francês. O seu papel é procurar os contrasensos, as omissões e as traduções que alteram o sentido original. Esta verificação é particularmente útil quando a tradução foi feita segmento a segmento: permite garantir que o conjunto se mantém coerente.
Por fim, preparam-se os subtítulos para a sua exibição no ecrã:
- corta-se o texto em pontos naturais;
- distribui-se o texto por uma ou duas linhas;
- verifica-se o comprimento e a legibilidade;
- garante-se que nenhuma palavra se perdeu.
O ficheiro chinês original é conservado como referência, para se poderem comparar as duas versões.
6. O resultado final
O resultado principal é um ficheiro:
video.fr.srt
Contém os subtítulos franceses com os respetivos horários.
A partir deste ficheiro, pode depois:
- gravar os subtítulos franceses no vídeo com ffmpeg;
- gerar uma versão dobrada em francês (text-to-speech, com as vozes gratuitas do Edge ou do Mac);
- criar automaticamente clippings ou excertos de vídeo a partir dos subtítulos e dos respetivos timestamps.
Em resumo
O workflow completo pode resumir-se assim:
Vídeo chinês → transcrição → correção → tradução → controlo de qualidade → subtítulos franceses → dobragem / clippings
O interesse desta organização é separar claramente as diferentes tarefas e deixar os agentes autónomos tratar as partes mais volumosas. A sessão principal mantém-se assim leve e concentra-se na orquestração do workflow.