idw – Informationsdienst Wissenschaft

Nachrichten, Termine, Experten

Grafik: idw-Logo
Science Video Project
idw-Abo

idw-News App:

AppStore

Google Play Store



Instanz:
Teilen: 
01.03.2013 13:36

Big Data: Saarbrücker Informatiker ermöglichen schnelle und effiziente Suche in großen Datenmengen

Friederike Meyer zu Tittingdorf Pressestelle der Universität des Saarlandes
Universität des Saarlandes

    Inzwischen häufen nicht nur Forschungsinstitutionen, sondern auch Unternehmen riesige Datenmengen an. Traditionelle Datenbanksysteme sind mit diesen oft überfordert. Brauchbare Werkzeuge wiederum enttäuschten bisher vor allem bei der Suche in „Big Data“. Saarbrücker Informatiker haben jetzt einen Ansatz entwickelt, mit dem man sehr schnell riesige Datenbestände nach komplexen Informationen durchsuchen kann. Ab 5. März stellen sie diesen auf dem saarländischen Forschungsstand auf der Computermesse Cebit in Hannover vor (Halle 9, Stand F34).

    Unter „Big Data“ versteht man riesige Mengen an digitalen Informationen, die so groß und so komplex sind, dass sie sich nicht mehr mit einfacher Datenbanktechnologie verarbeiten lassen. Nicht nur wissenschaftliche Einrichtungen wie das Kernforschungszentrum CERN häufen solche Datenberge an. Auch Unternehmen wie Google und Facebook tun dies und werten diese aus, um strategische Entscheidungen besser treffen zu können. Wie erfolgreich solche Analysen sein können, bewies vergangenes Jahr ein Artikel der Tageszeitung New York Times. Er berichtete vom US-amerikanischen Unternehmen „Target“, das aufgrund des Kaufverhaltens einer jungen Frau bereits vor deren Vater von ihrer Schwangerschaft wusste.

    Die dazu analysierte Datenmasse ist auf mehrere Dienstrechner (Server) im Internet verteilt. Die Suchfragen müssen also gleich an mehrere Rechner parallel gestellt werden. Herkömmliche Datenbanksysteme helfen nur bedingt weiter. Sie kommen mit der Datenmasse nicht klar oder überfordern ihre Anwender. Daher erfreuen sich die Datenanalysten umso mehr an den Werkzeugen, die auf dem frei verfügbaren Software-Framework Apache Hadoop basieren und dessen leistungsfähiges Dateisystem HDFS nutzen. Denn diese Systeme setzen keine hohe Expertise voraus.

    „Wenn man sich ein wenig in der Programmiersprache Java auskennt, kommt man damit schon relativ weit“, erklärt Jens Dittrich, Professor für Informationssysteme an der Universität des Saarlandes. Allerdings, so Dittrich, könne Hadoop nicht so effizient Datenmengen durchsuchen und verwalten, wie es die auf Parallelisierung ausgelegten Datenbanksysteme bisher ermöglichten. Hier setzen er und seine Mitarbeiter an. Mit der von ihnen entwickelten „Hadoop Aggressive Indexing Library“, kurz HAIL, ermöglichen sie es, in HDFS gewaltige Datenmengen so zu speichern, dass Suchanfragen bis zu 100 mal schneller beantwortet werden. Sie nutzen dazu eine Methode, die sich in ihrer einfachen Form in jedem Telefonbuch findet: Um nicht der Reihe nach alle Namen durchgehen zu müssen, sind die Einträge im Telefonbuch nach Namen geordnet. Die Sortierung der Namen bildet einen sogenannten Index.

    Einen solchen Index erzeugen die Saarbrücker Informatiker für sehr große Datenmengen, die sie auf diversen Servern verteilen. Im Gegensatz zum Telefonbuch sortieren sie die Daten aber nach mehreren Kriterien gleichzeitig und speichern die Daten mehrfach ab. „Je mehr Kriterien, desto vielfältiger können Sie suchen und desto höher ist die Wahrscheinlichkeit, dass Sie ihren Datensatz schnell finden“, erklärt Dittrich. „Für das Telefonbuchbeispiel würde das bedeuten, dass Sie gleich sechs verschiedene Telefonbücher haben. In jedem sind die Daten unterschiedlich angeordnet: entweder nach Name, Vorname, Straße, Postleitzahl, Vorort oder Telefonnummer. Mit dem richtigen Telefonbuch kann man dann Daten nach ganz unterschiedlichen Kriterien schnell finden.“ Der Clou ist: Seine Mitarbeiter und er haben die Erstellung dieser vielfältig einsetzbaren Indexe so organisiert, dass kein zusätzlicher Aufwand entsteht. Und auch der hierfür zusätzliche Speicherbedarf ist je nach Datensatz gering.

    Informatik-Forschung auf dem Campus der Universität des Saarlandes

    Die Fakultät für Informatik ist nicht die einzige Einrichtung, die auf dem Campus der Universität des Saarlandes neue Aspekte der Informatik erforschen. Nur wenige Meter entfernt haben ebenfalls ihren Sitz: das Max-Planck-Institut für Informatik, das Deutsche Forschungszentrum für Künstliche Intelligenz (DFKI), das Max-Planck-Institut für Softwaresysteme, das Zentrum für Bioinformatik, das Center for IT-Security, Privacy and Accountability (CISPA), das Intel Visual Computing Institute und der erneut bewilligte Exzellenzcluster „Multimodal Computing and Interaction“.

    Fragen beantwortet:

    Prof. Dr. Jens Dittrich
    Tel. 681 302 70141
    E-Mail: jens.dittrich@infosys.uni-saarland.de

    Redaktion:
    Gordon Bolduan
    Wissenschaftskommunikation
    Exzellenzcluster „Multimodal Computing and Interaction”
    Tel: 0681/ 302-70741
    Cebit-Stand 0511/ 89497024
    E-Mail: bolduan@mmci.uni-saarland.de

    Der saarländische Forschungsstand (Halle 9, Stand F34) wird von der Kontaktstelle für Wissens- und Technologietransfer der Universität des Saarlandes (KWT) betreut. Sie ist zentraler Ansprechpartner für Unternehmen und initiiert unter anderem Kooperationen mit Saarbrücker Forschern. Seit kurzem ist die Universität des Saarlandes auch „Gründerhochschule“ und wird dabei vom Bundeswirtschaftsministerium gefördert. Info: www.uni-saarland.de/kwt


    Weitere Informationen:

    http://infosys.uni-saarland.de/hadoop++.php
    http://www.uni-saarland.de/pressefotos


    Bilder

    Saarbrücker Informatiker können jetzt sehr schnell riesige Datenbestände nach komplexen Informationen durchsuchen.
    Saarbrücker Informatiker können jetzt sehr schnell riesige Datenbestände nach komplexen Informatione ...
    bellhäuser - das bilderwerk
    None


    Merkmale dieser Pressemitteilung:
    Journalisten, Wirtschaftsvertreter, Wissenschaftler
    Informationstechnik, Wirtschaft
    überregional
    Forschungs- / Wissenstransfer, Forschungsprojekte
    Deutsch


     

    Saarbrücker Informatiker können jetzt sehr schnell riesige Datenbestände nach komplexen Informationen durchsuchen.


    Zum Download

    x

    Hilfe

    Die Suche / Erweiterte Suche im idw-Archiv
    Verknüpfungen

    Sie können Suchbegriffe mit und, oder und / oder nicht verknüpfen, z. B. Philo nicht logie.

    Klammern

    Verknüpfungen können Sie mit Klammern voneinander trennen, z. B. (Philo nicht logie) oder (Psycho und logie).

    Wortgruppen

    Zusammenhängende Worte werden als Wortgruppe gesucht, wenn Sie sie in Anführungsstriche setzen, z. B. „Bundesrepublik Deutschland“.

    Auswahlkriterien

    Die Erweiterte Suche können Sie auch nutzen, ohne Suchbegriffe einzugeben. Sie orientiert sich dann an den Kriterien, die Sie ausgewählt haben (z. B. nach dem Land oder dem Sachgebiet).

    Haben Sie in einer Kategorie kein Kriterium ausgewählt, wird die gesamte Kategorie durchsucht (z.B. alle Sachgebiete oder alle Länder).