Categories: Workspace

VALL-E: AI-Modell für Text-to-Speech von Microsoft simuliert Stimmen

Forscher von Microsoft haben ein neues Text-to-Speech AI-Modell namens VALL-E vorgestellt. Es soll in der Lage sein, die Stimme einer Person zu simulieren. Dafür benötigt wird lediglich eine Audioaufnahme der Originalstimme von drei Sekunden. Wie Ars Technica berichtet kann VALL-E bei der synthetischen Erzeugung der Stimme sogar emotionale Betonungen des Sprechers wiedergeben.

Die Entwickler nennen als mögliches Einsatzgebiet hochqualitative Anwendungen für die Umwandlung von Text in Sprache. Es soll aber auch möglich sein, vorhandene Sprachaufnahmen einer Person zu verändern.

Microsoft zufolge analysiert VALL-E, wie eine Person spricht. Mithilfe der von Meta im Oktober 2022 angekündigten Technologie EnCodec werden die von VALL-E gewonnenen Informationen in einzelne als Tokens bezeichnete Komponenten unterteilt. So soll VALL-E in der Lage sein, aus einer Audioaufnahme von drei Sekunden abzuleiten, wie andere gesprochene Worte der Person klingen.

“ Um personalisierte Sprache zu synthetisieren, generiert VALL-E die entsprechenden akustischen Token auf der Grundlage der akustischen Token der 3-Sekunden-Aufnahme und des Phonem-Prompts, die die Sprecher- beziehungsweise Inhaltsinformationen einschränken. Schließlich werden die generierten akustischen Token verwendet, um die endgültige Wellenform mit dem entsprechenden neuronalen Codec-Decoder zu synthetisieren“, beschreibt Microsoft den Vorgang in einem Forschungsbericht.

Die Sprachsynthese von VALL-E wurde demnach mit einer von Meta zusammengestellten Audiobibliothek namens LibriLight angelernt. Sie enthält rund 60.000 Stunden englischsprachiger Aufnahmen von mehr als 7000 Personen, die wiederum der Public-Domain-Bibliothek für Audiobücher LibriVox entnommen wurden. Laut Microsoft erzielt VALL-E die besten Ergebnisse bei Stimmen, die einer Stimme aus den Trainingsdaten ähneln.

Die Entwickler von VALL-E sind sich aber auch der Möglichkeiten bewusst, ihr AI-Modell zu missbrauchen. „Da VALL-E Sprache synthetisieren kann, die die Identität des Sprechers beibehält, besteht die Gefahr, dass das Modell missbraucht wird, beispielsweise um die Stimmerkennung zu fälschen oder sich als ein bestimmter Sprecher auszugeben. Um solche Risiken zu minimieren, kann ein Erkennungsmodell erstellt werden, mit dem unterschieden werden kann, ob ein Audioclip von VALL-E synthetisiert wurde. Bei der Weiterentwicklung der Modelle werden wir auch die AI-Prinzipien von Microsoft in die Praxis umsetzen.“

Stefan Beiersmann

Stefan unterstützt seit 2006 als Freier Mitarbeiter die ZDNet-Redaktion. Wenn andere noch schlafen, sichtet er bereits die Nachrichtenlage, sodass die ersten News des Tages meistens von ihm stammen.

NextMicrosoft: Ransomware ist auch unter macOS ein Problem »

Previous « Apple arbeitet angeblich an eigenen Bluetooth- und WLAN-Chips

Published by

Stefan Beiersmann

Tags: Künstliche IntelligenzSpracherkennung

2 Jahren ago

Digitalisierung

Erreichbarkeit im Weihnachtsurlaub weiterhin hoch

Nur rund die Hälfte schaltet während der Feiertage komplett vom Job ab. Die anderen sind…

2 Wochen ago

VALL-E: AI-Modell für Text-to-Speech von Microsoft simuliert Stimmen

Recent Posts

KI-gestütztes Programmieren bringt IT-Herausforderungen mit sich

Studie: Ein Drittel aller E-Mails an Unternehmen sind unerwünscht

HubPhish: Phishing-Kampagne zielt auf europäische Unternehmen

1. Januar 2025: Umstieg auf E-Rechnung im B2B-Geschäftsverkehr

Google schließt schwerwiegende Sicherheitslücken in Chrome 131

Erreichbarkeit im Weihnachtsurlaub weiterhin hoch

VALL-E: AI-Modell für Text-to-Speech von Microsoft simuliert Stimmen

Related Post

Recent Posts

KI-gestütztes Programmieren bringt IT-Herausforderungen mit sich

Studie: Ein Drittel aller E-Mails an Unternehmen sind unerwünscht

HubPhish: Phishing-Kampagne zielt auf europäische Unternehmen

1. Januar 2025: Umstieg auf E-Rechnung im B2B-Geschäftsverkehr

Google schließt schwerwiegende Sicherheitslücken in Chrome 131

Erreichbarkeit im Weihnachtsurlaub weiterhin hoch