Fine tuned XLSR 53 large model for speech recognition in English Fine tuned facebook/wav2vec2 large xlsr 53 on English using the train and validation splits of Common Voice 6.1. When using this model, make sure that your speech input is sampled at 16kHz. This model has been fine tuned thanks to the GPU credits generously given by the OVHcloud :) The script used for training can be found here: https://github.com/jonatasgrosman/wav2vec2 sprint Usage The model can be used directly (without a language model) as follows... Using the HuggingSound library: Writing your own inference script: Reference Prediction "SHE'LL BE ALL RIGHT." SHE'LL BE ALL RIGHT SIX SIX "ALL'S WELL THAT ENDS WELL." ALL AS WELL THAT ENDS WELL DO YOU MEAN IT? DO YOU MEAN IT THE NEW PATCH IS LESS INVASIVE THAN THE OLD ONE, BUT STILL CAUSES REGRESSIONS. THE NEW PATCH IS LESS INVASIVE THAN THE OLD ONE BUT STILL CAUSES REGRESSION HOW IS MOZILLA GOING TO HANDLE AMBIGUITIES LIKE QUEUE AND CUE? HOW IS MOSLILLAR GOING TO HANDLE ANDBEWOOTH HIS LIKE Q AND Q "I GUESS YOU MUST THINK I'M KINDA BATTY." RUSTIAN WASTIN PAN ONTE BATTLY NO ONE NEAR THE REMOTE MACHINE YOU COULD RING? NO ONE NEAR THE REMOTE MACHINE YOU COULD RING SAUCE…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy