ÁudioOpen source

CrisperWhisper 2: transcrição com o tempo de cada palavra

Dois modos de saída — o que a pessoa falou de verdade e o que ela quis dizer. Roda até sem placa de vídeo.

Nyra LabsIntrodutório7 min de leitura1 de 3 aulas liberadas

CrisperWhisper 2 transforma áudio em texto, como qualquer transcritor. A diferença está em duas escolhas de projeto que resolvem problemas opostos com o mesmo modelo.

A primeira é ter dois modos de saída. A segunda é entregar o tempo de início e fim de cada palavra, não do bloco inteiro — o que muda completamente o que dá para automatizar depois.

Por que isso importa

  • Legenda no tempo certo depende de marcação por palavra; sem isso o alinhamento é feito no olho.

+ 2 pontos nos planos pagos.

Ficha técnica

Licença
Open source (modelos no Hugging Face)
Modelos
4, de 0,2 B a 2 B de parâmetros
Menor modelo
< 500 MB, roda sem GPU
Marcação de tempo
Por palavra
Teste online
Espaço gratuito no Hugging Face

O microcurso

1.Os dois modos — e quando usar cada um

2 min
  • Verbatim. Transcreve tudo: gagueira, hesitação, risada, repetição, marcações de comportamento. É o que você quer para entrevista, pesquisa qualitativa, análise de fala e legenda fiel.
  • Intended. Remove hesitações e ruído de fala e devolve o texto limpo. É o que você quer para ata, artigo, roteiro e qualquer coisa que vá ser lida.

Repare que a escolha não é sobre qualidade — é sobre destino do texto. O erro comum é rodar tudo no modo limpo e perceber tarde demais que a hesitação era o dado que importava.

  • Testar sem instalar nada2 min
  • Escolher o tamanho do modelo2 min
Conteúdo do plano Expert

Faltam 2 aulas para você concluir

Você está vendo a ficha da ferramenta — o que ela é e o que ela não faz. O passo a passo, os critérios de escolha e o que fazer com ela ficam no microcurso, e o microcurso completo é do Expert.

  1. Gratuitoseu planoFicha da ferramenta
  2. Explorador1ª aula + limitações
  3. Profissional2ª aula + para quem serve
  4. ExpertMicrocurso completo

O Explorador (R$ 57/mês) abre 2 de 3 aulas. Só o Expert abre todas — e vale para todos os microcursos da seção.

De onde saiu este microcurso

Do capítulo Crisper Whisper (aos 01:47) do vídeo New Deepseek, Seedance 2.5, Minimax H3, Gemini Robotics, AMD models: AI NEWS, do canal AI Search. Transcrevemos, conferimos os nomes contra as páginas oficiais e reescrevemos em português.

Continue por aqui

FAYAI
CrisperWhisper 2: transcrição com o tempo de cada palavra — microcurso completo | FayAI