Categories: ForschungInnovation

Facebook stellt M2-M100 vor

Facebook AI hat einen neuen Meilenstein für M2M-100 angekündigt und öffnet es der der Open Source Community. M2M-100 MMT gilt als genauer als andere Übersetzungsmodelle, weil es nicht Englisch als Vermittler verwenden muss.

In der Regel sind die Modelle auf Englisch zentriert. Die Übersetzung von Chinesisch ins Französische oder Chinesisch ins Spanische würde also vor dem endgültigen Bestimmungsort eine Übersetzung ins Englische erfordern.

Facebook argumentiert, dass direkte Übersetzungen zwischen Sprachen mehr Bedeutung erfassen und englisch-zentrierte Systeme beim Bilingual Evaluation Understudy (BLEU) Score um zehn Punkte übertreffen.

M2M-100 wird in 2.200 Sprachrichtungen trainiert. Wie Facebook mitteilte, wird es das Modell, das Training und die Evaluierungseinrichtung für M2M-100 auch für andere Forscher freigeben.

Facebook AI beschreibt das Verfahren so: „Um die Sprachen der verschiedenen Gruppen miteinander zu verbinden, haben wir eine kleine Anzahl von Brückensprachen identifiziert, bei denen es sich in der Regel um ein bis drei Hauptsprachen jeder Gruppe handelt. Im obigen Beispiel wären Hindi, Bengali und Tamil Brückensprachen für indoarische Sprachen. Dann haben wir parallele Trainingsdaten für alle möglichen Kombinationen dieser Brückensprachen ermittelt. Mit dieser Technik ergab unser Trainingsdatensatz am Ende 7,5 Milliarden parallele Datensätze, die 2.200 Richtungen entsprachen.“

Facebook hat in seinem Netzwerk maschinelle Übersetzung eingesetzt, aber die Erstellung separater KI-Modelle für jede Sprache und Aufgabe hat sich nicht verkauft. Immerhin führt Facebook jeden Tag 20 Milliarden Übersetzungen im Facebook News Feed aus.

Um das MMT-Modell zu trainieren, musste Facebook qualitativ hochwertige Satzpaare in mehreren Sprachen ohne Englisch neufassen. Es gibt mehr Übersetzungen ins Englische als direkt zwischen den Sprachen.

Letztendlich erstellte Facebook einen MMT-Datensatz von 7,5 Milliarden Satzpaaren in 100 Sprachen. Von da an schränkte Facebook die Paare auf qualitativ hochwertige und hohe Datenpaare ein. Statistisch seltene Übersetzungspaare wurden vermieden.

ANZEIGE

So reagieren Sie auf die gestiegene Nachfrage von Online-Videos – Wichtige Erkenntnisse und Trends

Der von zahlreichen Ländern wegen der Coronakrise eingeführte Lockdown und die damit verbundene soziale Distanzierung haben neue Rekorde im Online-Videoverkehr gebracht. Erfahren Sie in diesem Webinar, wie Sie Daten untersuchen und quantifizieren, um die Belastung von Netzwerken und CDNs einzuschätzen.

ZDNet.de Redaktion

Recent Posts

Studie: Ein Drittel aller E-Mails an Unternehmen sind unerwünscht

Der Cybersecurity Report von Hornetsecurity stuft 2,3 Prozent der Inhalte gar als bösartig ein. Die…

3 Tagen ago

HubPhish: Phishing-Kampagne zielt auf europäische Unternehmen

Die Hintermänner haben es auf Zugangsdaten zu Microsoft Azure abgesehen. Die Kampagne ist bis mindestens…

4 Tagen ago

1. Januar 2025: Umstieg auf E-Rechnung im B2B-Geschäftsverkehr

Cloud-Plattform für elektronische Beschaffungsprozesse mit automatisierter Abwicklung elektronischer Rechnungen.

4 Tagen ago

Google schließt schwerwiegende Sicherheitslücken in Chrome 131

Mindestens eine Schwachstelle erlaubt eine Remotecodeausführung. Dem Entdecker zahlt Google eine besonders hohe Belohnung von…

4 Tagen ago

Erreichbarkeit im Weihnachtsurlaub weiterhin hoch

Nur rund die Hälfte schaltet während der Feiertage komplett vom Job ab. Die anderen sind…

5 Tagen ago

Hacker missbrauchen Google Calendar zum Angriff auf Postfächer

Security-Experten von Check Point sind einer neuen Angriffsart auf die Spur gekommen, die E-Mail-Schutzmaßnahmen umgehen…

6 Tagen ago