IBM und die British Library planen, im Rahmen eines Projekts namens BigSheets viele Terabyte an Internetdaten zu analysieren und die wichtigsten zu archivieren. Als technische Basis dienen Open-Source-Tools, unter anderem Hadoop, Nutch und Pig.
Die durchschnittliche Lebensdauer einer Webseite beträgt Forschern zufolge zwischen 44 und 75 Tage. In Großbritannien gehen innerhalb von sechs Monaten ungefähr zehn Prozent der im Web gespeicherten Informationen verloren. Das ist in vielen Fällen kein großer Verlust – in manchen aber doch. IBM BigSheets soll die Spreu vom Weizen trennen und wichtige Daten aus Nachrichten, Medien, Videos in einem leicht zugänglichen Format archivieren. Ziel ist es, die Daten auch mit Anmerkungen zu versehen und eine visuelle Analyse im Browser zu ermöglichen.
Die britische Nationalbibliothek, die ohnehin schon ein Exemplar jeglicher Publikation im Land bekommt, hatte 2004 damit begonnen, bestimmte Websites mit UK-Domains regelmäßig zu speichern. Laut IBMs CTO für neue Technologien, David Boloker, wird dieses Vorgehen einmal Historikern ein gewaltiges Archiv an die Hand geben.
Die für BigSheets genutzte Software setzt auf Open-Source-Komponenten auf. Darunter ist mit Hadoop eine Implementierung eines Frameworks für skalierbares Distributed Computing und Datenspeicherung. Das Suchprojekt Nutch basiert auf Lucene Java, fügt ihm aber internetspezifische Komponenten wie einen Crawler und einen HTML-Parser hinzu. Es kann auch Links in einer Datenbank ablegen und grafisch darstellen. Mit Pig baut IBM zudem auf eine Open-Source-Plattform, die eine Hochsprache für die Datenanalyse im großen Maßstab bereitstellt und mit einer Infrastruktur verbindet, um in der Sprache geschriebene Programme zu evaluieren. Alle drei stehen unter Apache-Lizenz.
Boloker zufolge ist BigSheets als privater Clouddienst implementiert, der auf allen Maschinen der Bibliothek parallele MapReduce-Prozesse aufsetzt. Die British Library will die Daten und Dienste irgendwann auch der Öffentlichkeit zur Verfügung stellen.
Bösartige QR-Codes, die per E-Mail versendet werden, eignen sich sehr gut, um Spam-Filter zu umgehen.
Unsichere Websites und Phishing-Mails in Verbindung mit Black Friday können kauffreudigen Konsumenten zum Verhängnis werden.
Malware SmokeLoader wird weiterhin von Bedrohungsakteuren genutzt, um Payloads über neue C2-Infrastrukturen zu verbreiten.
Bankhaus Metzler und Telekom-Tochter MMS testen, inwieweit Bitcoin-Miner das deutsche Stromnetz stabilisieren könnten.
Mit 1,7 Exaflops ist El Capitan nun der dritte Exascale-Supercomputer weltweit. Deutschland stellt erneut den…
Der deutsche Hyperscaler erweitert sein Server-Portfolio um vier Angebote mit den neuen AMD EPYC 4004…