ÁudioOpen sourceMicrocurso grátis

CrisperWhisper 2: transcrição com o tempo de cada palavra

Dois modos de saída — o que a pessoa falou de verdade e o que ela quis dizer. Roda até sem placa de vídeo.

Nyra LabsIntrodutório7 min

CrisperWhisper 2 transforma áudio em texto, como qualquer transcritor. A diferença está em duas escolhas de projeto que resolvem problemas opostos com o mesmo modelo.

A primeira é ter dois modos de saída. A segunda é entregar o tempo de início e fim de cada palavra, não do bloco inteiro — o que muda completamente o que dá para automatizar depois.

Por que isso importa

  • Legenda no tempo certo depende de marcação por palavra; sem isso o alinhamento é feito no olho.
  • O modelo menor tem menos de 500 MB e roda sem GPU — cabe em praticamente qualquer computador.
  • Em comparação publicada pelos autores, sai à frente de serviços pagos conhecidos, inclusive em erro de marcação de tempo.

1.Os dois modos — e quando usar cada um

2 min
  • Verbatim. Transcreve tudo: gagueira, hesitação, risada, repetição, marcações de comportamento. É o que você quer para entrevista, pesquisa qualitativa, análise de fala e legenda fiel.
  • Intended. Remove hesitações e ruído de fala e devolve o texto limpo. É o que você quer para ata, artigo, roteiro e qualquer coisa que vá ser lida.

Repare que a escolha não é sobre qualidade — é sobre destino do texto. O erro comum é rodar tudo no modo limpo e perceber tarde demais que a hesitação era o dado que importava.

Ficha técnica

Licença
Open source (modelos no Hugging Face)
Modelos
4, de 0,2 B a 2 B de parâmetros
Menor modelo
< 500 MB, roda sem GPU
Marcação de tempo
Por palavra
Teste online
Espaço gratuito no Hugging Face

Continue no microcurso completo

Você leu a primeira de 3 aulas

A versão detalhada traz o passo a passo completo, os critérios de escolha, onde a ferramenta falha e para quem ela realmente serve.

  • Testar sem instalar nada2 min
  • Escolher o tamanho do modelo2 min
Ver o microcurso completo

De onde saiu este microcurso

Do capítulo Crisper Whisper (aos 01:47) do vídeo New Deepseek, Seedance 2.5, Minimax H3, Gemini Robotics, AMD models: AI NEWS, do canal AI Search. Transcrevemos, conferimos os nomes contra as páginas oficiais e reescrevemos em português.

Continue por aqui

FAYAI