IBM-Projekt BigSheets analysiert Websites mit Open-Source-Tools

IBM und die British Library planen, im Rahmen eines Projekts namens BigSheets viele Terabyte an Internetdaten zu analysieren und die wichtigsten zu archivieren. Als technische Basis dienen Open-Source-Tools, unter anderem Hadoop, Nutch und Pig.

Die durchschnittliche Lebensdauer einer Webseite beträgt Forschern zufolge zwischen 44 und 75 Tage. In Großbritannien gehen innerhalb von sechs Monaten ungefähr zehn Prozent der im Web gespeicherten Informationen verloren. Das ist in vielen Fällen kein großer Verlust – in manchen aber doch. IBM BigSheets soll die Spreu vom Weizen trennen und wichtige Daten aus Nachrichten, Medien, Videos in einem leicht zugänglichen Format archivieren. Ziel ist es, die Daten auch mit Anmerkungen zu versehen und eine visuelle Analyse im Browser zu ermöglichen.

Die britische Nationalbibliothek, die ohnehin schon ein Exemplar jeglicher Publikation im Land bekommt, hatte 2004 damit begonnen, bestimmte Websites mit UK-Domains regelmäßig zu speichern. Laut IBMs CTO für neue Technologien, David Boloker, wird dieses Vorgehen einmal Historikern ein gewaltiges Archiv an die Hand geben.

Die für BigSheets genutzte Software setzt auf Open-Source-Komponenten auf. Darunter ist mit Hadoop eine Implementierung eines Frameworks für skalierbares Distributed Computing und Datenspeicherung. Das Suchprojekt Nutch basiert auf Lucene Java, fügt ihm aber internetspezifische Komponenten wie einen Crawler und einen HTML-Parser hinzu. Es kann auch Links in einer Datenbank ablegen und grafisch darstellen. Mit Pig baut IBM zudem auf eine Open-Source-Plattform, die eine Hochsprache für die Datenanalyse im großen Maßstab bereitstellt und mit einer Infrastruktur verbindet, um in der Sprache geschriebene Programme zu evaluieren. Alle drei stehen unter Apache-Lizenz.

Boloker zufolge ist BigSheets als privater Clouddienst implementiert, der auf allen Maschinen der Bibliothek parallele MapReduce-Prozesse aufsetzt. Die British Library will die Daten und Dienste irgendwann auch der Öffentlichkeit zur Verfügung stellen.

ZDNet.de Redaktion

Recent Posts

Gaming-bezogene Phishing-Attacken um 30 Prozent gestiegen

Über drei Millionen Angriffsversuche unter Deckmantel von Minecraft / YouTube-Star Mr. Beast als prominenter Köder

2 Tagen ago

KI erleichtert Truckern die Parkplatzsuche

Die Prognose für die Anfahrt bezieht das Verkehrsaufkommen, die Stellplatzverfügbarkeit sowie die Lenk- und Ruhezeiten…

2 Tagen ago

EU AI-Act Risk Assessment Feature

Unternehmen können mit Casebase Portfolio an Daten- und KI-Anwendungsfällen organisieren.

2 Tagen ago

Smarthome-Geräte sind Einfallstor für Hacker

Smart-TV oder Saugroboter: Nutzer schützen ihre smarten Heimgeräte zu wenig, zeigt eine repräsentative BSI-Umfrage.

2 Tagen ago

Core Ultra 200V: Intel stellt neue Notebook-Prozessoren vor

Im Benchmark erreicht der neue Core Ultra 200V eine Laufzeit von 14 Stunden. Intel tritt…

2 Tagen ago

Irrglaube Inkognito-Modus

Jeder dritte hält sich damit für unsichtbar. Wie widersprüchlich unser Datenschutzverhalten oft ist, zeigt eine…

3 Tagen ago