Yahoo veröffentlicht Big Data für KI-Forscher

Yahoo hat eine unkomprimiert 13,5 TByte große Datensammlung für Forscher verfügbar gemacht. Sie soll Datenwissenschaftlern als Test- und Analysematerial dienen, wie Suju Rajan von den Yahoo Labs in einem Blogbeitrag schreibt. Die Sammlung wird Yahoo News Feed genannt.

„Viele akademische Forscher und Datenwissenschaftler haben keinen Zugang zu wirklich großen Datensätzen, weil diese traditionell nur in großen Firmen vorhanden sind“, schreibt Rajan. Es handle sich um anonymisierte Zugriffe von etwa 20 Millionen Nutzern auf eine Reihe von Yahoo-Sites, darunter die Bereiche Filme, Finanzen, Immobilien, Nachrichten und Sport sowie die Yahoo-Homepage. Dafür wurden zwischen Februar und Mai 2015 über 110 Milliarden Vorgänge erfasst.

Die anonymen Daten enthalten gleichwohl Angaben zum Altersbereich, Geschlecht und ungefährem Standort, daneben Zeitstempel, Titel, Zusammenfassungen und Schlüsselausdrücke abgerufener Artikel. Auch spezifizieren sie, welches Gerät und welche Software für den Zugriff genutzt wurde. Sie enthalten auch Bilder und die mit den Inhalten ausgelieferte Werbung.

Als ersten Nutzer der Daten für die akademische Forschung weist Yahoo die University of California in San Diego vor. Diese erprobt damit den Einsatz von „Maschinellem Lernen, Künstlicher Intelligenz und Big-Data-Anwendungen.“ Für die Universität kommentiert Professor Gert Lanckriet: „Zugang zu Datensätzen dieser Größe ist essenziell, um Algorithmen und Techniken für Maschinelles Lernen zu konzipieren und zu schreiben, die sich dann für wirkliche ‚Big Data‘ eignen.“

Forscher können die Daten aus der Webscope-Bibliothek der Yahoo Labs herunterladen. Komprimiert umfassen sie immer noch 1,5 TByte. In Webscope hatte Yahoo insgesamt schon 56 Datensammlungen verfügbar gemacht. Die bisher größte umfasste unkomprimiert 1 TByte.

WEBINAR

Wie eine optimale IT-Infrastruktur für UCC-Lösungen die Produktivität Ihrer Mitarbeiter steigert

Das Webinar “Wie eine optimale IT-Infrastruktur für UCC-Lösungen die Produktivität Ihrer Mitarbeiter steigert” informiert Sie über die Vorteile einer Unified Communications & Collaboration-Lösung (UCC) und skizziert die technischen Grundlagen, die für die erfolgreiche Implementierung nötig sind. Jetzt registrieren und die aufgezeichnete Fassung des Webinars ansehen.

Yahoo hat sich zuletzt besonders intensiv um externe Entwickler bemüht. So wurden Algorithmen für die Auswertung von Datenströmen und ein speziell für strukturierte Daten auf Websites ausgelegter Webcrawler öffentlich gemacht.

Die auf Mobilanwendungen und Unterhaltung ausgerichtete Strategie von CEO Marissa Mayer scheint noch aber zur erhofften Trendwende zu führen. Im Management muss Yahoo immer wieder Abgänge hinnehmen, und die Belegschaft will es nun einem Bericht zufolge um 10 Prozent reduzieren. Es reagiert damit offenbar auf Kritik von Investoren, die auch schon Mayers Ablösung fordern.

[mit Material von Rachel King, ZDNet.com]

Tipp: Was haben Sie über Big Data abgespeichert? Überprüfen Sie Ihr Wissen – mit 15 Fragen auf silicon.de.

Florian Kalenda

Seit dem Palm Vx mit Klapp-Tastatur war Florian mit keinem elektronischen Gerät mehr vollkommen zufrieden. Er nutzt derzeit privat Android, Blackberry, iOS, Ubuntu und Windows 7. Die Themen Internetpolitik und China interessieren ihn besonders.

Recent Posts

Microsoft verschiebt erneut Copilot Recall

Die Entwickler arbeiten noch an weiteren „Verfeinerungen“. Windows Insider erhalten nun wohl eine erste Vorschau…

4 Stunden ago

GenKI im Job: Mitarbeitende schaffen Tatsachen

Laut Bitkom-Umfrage werden in jedem dritten Unternehmen in Deutschland private KI-Zugänge genutzt. Tendenz steigend.

6 Stunden ago

97 Prozent der Großunternehmen melden Cyber-Vorfälle

2023 erlitten neun von zehn Unternehmen in der DACH-Region Umsatzverluste und Kurseinbrüche in Folge von…

6 Stunden ago

„Pacific Rim“-Report: riesiges, gegnerisches Angriffs-Ökosystem

Der Report „Pacific Rim“ von Sophos beschreibt Katz-und-Maus-Spiel aus Angriffs- und Verteidigungsoperationen mit staatlich unterstützten…

10 Stunden ago

DeepL setzt erstmals auf NVIDIA DGX SuperPOD mit DGX GB200-Systemen

NVIDIA DGX SuperPOD soll voraussichtlich Mitte 2025 in Betrieb genommen und für Forschungsberechnungen genutzt werden.

10 Stunden ago

Latrodectus: Gefährlicher Nachfolger von IcedID

Latrodectus, auch bekannt als BlackWidow, ist auch unter dem Namen LUNAR SPIDER bekannt.

10 Stunden ago