CrisperWhisper 2 transforma áudio em texto, como qualquer transcritor. A diferença está em duas escolhas de projeto que resolvem problemas opostos com o mesmo modelo.
A primeira é ter dois modos de saída. A segunda é entregar o tempo de início e fim de cada palavra, não do bloco inteiro — o que muda completamente o que dá para automatizar depois.
Por que isso importa
- Legenda no tempo certo depende de marcação por palavra; sem isso o alinhamento é feito no olho.
- O modelo menor tem menos de 500 MB e roda sem GPU — cabe em praticamente qualquer computador.
- Em comparação publicada pelos autores, sai à frente de serviços pagos conhecidos, inclusive em erro de marcação de tempo.
1.Os dois modos — e quando usar cada um
2 min- Verbatim. Transcreve tudo: gagueira, hesitação, risada, repetição, marcações de comportamento. É o que você quer para entrevista, pesquisa qualitativa, análise de fala e legenda fiel.
- Intended. Remove hesitações e ruído de fala e devolve o texto limpo. É o que você quer para ata, artigo, roteiro e qualquer coisa que vá ser lida.
Repare que a escolha não é sobre qualidade — é sobre destino do texto. O erro comum é rodar tudo no modo limpo e perceber tarde demais que a hesitação era o dado que importava.
Ficha técnica
- Licença
- Open source (modelos no Hugging Face)
- Modelos
- 4, de 0,2 B a 2 B de parâmetros
- Menor modelo
- < 500 MB, roda sem GPU

Continue no microcurso completo
Você leu a abertura de 3 aulas
O microcurso traz o passo a passo completo, os critérios de escolha, onde a ferramenta falha, para quem ela realmente serve — e, no Expert, o endereço oficial para começar hoje.
- Testar sem instalar nada2 min
- Escolher o tamanho do modelo2 min
Como apuramos
Acompanhamos os lançamentos direto nas fontes primárias, transcrevemos o que é demonstrado, conferimos cada nome e cada número contra a documentação oficial do fabricante e reescrevemos em português — com o que a ferramenta não faz junto, que é a parte que o anúncio omite.


