Meta introduceert Muse Voice Transcribe voor realtime en meertalige transcriptie

Meta heeft met Muse Voice Transcribe een nieuw audiomodel uitgebracht dat spraak in realtime kan omzetten naar tekst. De technologie is ontworpen om complexe gespreksdynamieken te verwerken en kan meer dan twintig verschillende sprekers binnen één audiofragment van elkaar onderscheiden en herkennen.

Een van de belangrijkste kenmerken van Muse Voice Transcribe is de verwerking van meertalige gesprekken. Het model kan moeiteloos omgaan met situaties waarin sprekers tijdens hetzelfde gesprek tussentijds van taal wisselen, een fenomeen dat bekendstaat als code-switching. Om deze prestaties te behalen is het audiomodel getraind op een dataset van meer dan zeventig talen.

De technologie biedt bovendien grote voordelen voor podcastmakers en de videosector. Doordat het model moeiteloos tientallen stemmen uit elkaar houdt, worden complexe studiogesprekken en paneldiscussies sneller uitgeschreven. Dit vereenvoudigt het maken van shownotes en maakt tekstgebaseerde audio-edits aanzienlijk efficiënter. Daarnaast maakt de realtime verwerking het mogelijk om livestreams, webinars en video-uitzendingen direct te voorzien van accurate live-ondertiteling. Ook bij internationale content waarin sprekers vloeiend tussen talen schakelen, blijft de transcriptie foutloos doorlopen. Ten slotte vergroten de direct gegenereerde transcripties de toegankelijkheid voor slechthorenden, terwijl videocontent beter vindbaar wordt voor zoekmachines.

Spreekbuis.nl

WAARDEER DIT ARTIKEL!

Als je dit artikel waardeert en je waardering wilt laten blijken met een kleine bijdrage, dan kan dat. Zo help je onafhankelijke mediajournalistiek in stand houden.

Donatie Spreekbuis € -