CrisperWhisper 2 transforma áudio em texto, como qualquer transcritor. A diferença está em duas escolhas de projeto que resolvem problemas opostos com o mesmo modelo.
A primeira é ter dois modos de saída. A segunda é entregar o tempo de início e fim de cada palavra, não do bloco inteiro — o que muda completamente o que dá para automatizar depois.
Por que isso importa
- Legenda no tempo certo depende de marcação por palavra; sem isso o alinhamento é feito no olho.
- O modelo menor tem menos de 500 MB e roda sem GPU — cabe em praticamente qualquer computador.
- Em comparação publicada pelos autores, sai à frente de serviços pagos conhecidos, inclusive em erro de marcação de tempo.
1.Os dois modos — e quando usar cada um
2 min- Verbatim. Transcreve tudo: gagueira, hesitação, risada, repetição, marcações de comportamento. É o que você quer para entrevista, pesquisa qualitativa, análise de fala e legenda fiel.
- Intended. Remove hesitações e ruído de fala e devolve o texto limpo. É o que você quer para ata, artigo, roteiro e qualquer coisa que vá ser lida.
Repare que a escolha não é sobre qualidade — é sobre destino do texto. O erro comum é rodar tudo no modo limpo e perceber tarde demais que a hesitação era o dado que importava.
Ficha técnica
- Licença
- Open source (modelos no Hugging Face)
- Modelos
- 4, de 0,2 B a 2 B de parâmetros
- Menor modelo
- < 500 MB, roda sem GPU
- Marcação de tempo
- Por palavra
- Teste online
- Espaço gratuito no Hugging Face

Continue no microcurso completo
Você leu a primeira de 3 aulas
A versão detalhada traz o passo a passo completo, os critérios de escolha, onde a ferramenta falha e para quem ela realmente serve.
- Testar sem instalar nada2 min
- Escolher o tamanho do modelo2 min
De onde saiu este microcurso
Do capítulo “Crisper Whisper” (aos 01:47) do vídeo New Deepseek, Seedance 2.5, Minimax H3, Gemini Robotics, AMD models: AI NEWS, do canal AI Search. Transcrevemos, conferimos os nomes contra as páginas oficiais e reescrevemos em português.


