Da sottotitoli a trascrizione

Hai il file dei sottotitoli di una riunione o di un video e ti serve il testo, non i numeri. Carica il tuo .srt o .vtt e ne esce prosa: tempi via, frasi ricomposte, e soprattutto tolte le ripetizioni delle didascalie che scorrono. Serve un file che hai già: da qui non si scarica da nessun sito.

Tocca qui o trascina il file .srt o .vtt
secondi
Il file non viene caricato da nessuna parte: resta nel tuo browser.

Il problema vero non sono i tempi

Togliere i numeri e gli orari lo fa chiunque. Il guaio dei sottotitoli automatici è un altro: scorrono, cioè ogni riquadro ripete la coda di quello prima per farla salire, e il testo che ne esce dice ogni frase due o tre volte. Un file così, dato in pasto a qualcuno o a qualcosa che deve riassumerlo, è lungo il triplo del necessario e pieno di echi.

Ho solo l’audio, non i sottotitoli

Capita a metà di chi arriva qui, e la risposta onesta è che i sottotitoli quasi sempre esistono già da qualche parte. Se la riunione l’ha registrata un programma di videochiamate, accanto alla registrazione c’è quasi sempre un file di trascrizione da scaricare. Se il video è tuo ed è su una piattaforma video, i sottotitoli automatici si prendono dal pannello di chi l’ha caricato. Se hai davvero solo un file audio, i programmi di scrittura più diffusi hanno una funzione di trascrizione, e la tastiera del telefono ha la dettatura. Un riconoscimento vocale qui dentro non c’è, e non è una dimenticanza: farlo nel browser vuol dire scaricare decine di megabyte a ogni visita, e i modelli che ci starebbero sbagliano circa una parola su quattro sul parlato spontaneo, con errori che sono parole italiane vere e quindi invisibili a chi rilegge. Quando i sottotitoli ce li hai, il resto lo fa questa pagina; se i tempi sono sfasati passa da Sincronizza i sottotitoli, e se vuoi sapere se si leggono davvero c’è Controlla i sottotitoli.

Come decide se tagliare

Prima misura tutto il file: guarda quante coppie di riquadri consecutivi si sovrappongono nei tempi e ripetono davvero le stesse parole. Se sono la maggioranza, sono didascalie a scorrimento e le fonde. Se sono due o tre, sono ripetizioni vere di chi parla, e non tocca niente: così un «no, no, no» resta «no, no, no». Il confronto è esatto, parola per parola, mai a somiglianza.

Quello che ha fatto è scritto

Sotto il risultato trovi quante battute ha letto, quante code ripetute ha fuso e quante parole ha tolto. Il pulsante «Vedi il testo grezzo» mostra le battute una per riga, senza fusioni: serve a controllare, in dieci secondi, che non sia sparito niente.

I nomi di chi parla

I nomi ci sono solo se la piattaforma li ha scritti nel file: succede con Teams, Zoom e Meet, e con i .vtt che usano <v Nome>. I sottotitoli automatici di YouTube non li hanno, e in quel caso te lo dice: capire chi parla dal solo audio non si può, e inventarlo sarebbe peggio che tacere. Se i nomi ci sono, puoi anche sostituirli con Relatore 1, 2, 3, che è un modo di anonimizzarli, non di riconoscerli.

Punteggiatura e paragrafi

I paragrafi si chiudono su un punto, su un cambio di voce o su una pausa (la regoli tu). Se i sottotitoli non hanno punteggiatura, e le trascrizioni automatiche spesso non ce l'hanno, restano solo le pause: te lo scrive, perché la punteggiatura non si inventa. E le parole capite male dalla trascrizione automatica restano sbagliate: qui si sistema la forma, non il contenuto.