Hier könnte Ihre Werbung stehen. Weitere Infos und Mediadaten finden Sie hier.

SEO-News

YahooYahoo stellt seinen Crawler Anthelion als Open Source-Projekt unter Apache zur Verfügung. Anthelion kann in HTML eingebettete strukturierte Daten erkennen und Seiten mit strukturierten Daten bevorzugt besuchen und funktioniert als Plugin des Crawlers Apache Nutch.

Strukturierte Daten sind für Suchmaschinen ein wichtiges Hilfsmittel, Inhalte von Webseiten und anderen Dokumenten zu verstehen und zu interpretieren. Die Daten unterstützen erstens die verwendeten Algorithmen bei der Klassifizierung von Webseiten und sparen zweitens Rechenkapazitäten.

Yahoo hat jetzt seinen Crawler für die Erfassung von strukturierten Daten in Webseiten offengelegt und stellt ihn als Open Source-Projekt unter Apache zur Verfügung. Der Name des Projekts lautet Anthelion und leitet sich vom griechischen "gegenüber der Sonne" ab. Er beschreibt eine optische Täuschung, bei der eine weiße, horizontale Linie gegenüber der Sonne sichtbar ist.

Anthelion ist ein Plugin für den Crawler Apache Nutch und erweitert bestimmte Klassen des Projekts. Das Anthelion-Plugin enthält diese Erweiterungen:

  • AnthelionScoringFilter: Dieser Filter klassifiziert ausgehende Links als relevant oder nicht relevant. Jeder ausgehende Link erhält eine Bewertung (Score). Diese Bewertung wird als Grundlage für die Auswahl von Links für die nächste Crawling-Runde verwendet. Außerdem liefert die Erweiterung Feedback für bereits besuchte Seiten.
  • WdcParser: Diese Erweiterung ist verantwortlich für das Parsen der Webseiteninhalte und für die Erkennung strukturierter Daten. Dabei kommt die any23-Bibliothek zum Einsatz, mit der strukturierte Daten in den Formaten Microdata, Microformats und RDFa ausgelesen werden können.
  • TripleExtractor: speichert zusätzliche Felder im Index, die später für Suchabfragen verwendet werden können.

Der Crawling-Prozess unter Verwendung von Apache Nutch mit Anthelion sieht so aus:Anthelion: der Crawling-Prozess

Die roten Felder kennzeichnen die gegenüber dem Crawling mit Nutch angepassten Prozesse.

Bei Anthelion handelt es sich um einen sogenannten Fokussierten Crawler (Focused Crawler). Im Gegensatz zu anderen Crawlern dieser Kategorie ist Anthelion jedoch nicht auf ein bestimmtes Thema ausgerichtet, sondern blickt auf die Daten der Webseiten: Webseiten, die strukturierte Daten enthalten, verfügen über bestimmte Eigenschaften, die Anthelion erkennen kann.

Anthelion grenzt sich außerdem von semantischen Crawlern wie Slug oder LDSpider ab, die für bestimmte Aufgaben im Zusammenhang mit RDF-Daten ausgelegt sind (verschiedene RDF-Formate, Kommunikationsprotokolle etc.). Anthelion ist klar auf die strukturierten Daten ausgelegt, die in das HTML von Webseiten eingebettet sind.

Während des Crawlens lernt Anthelion dazu: Daten, die beim Crawlen gefunden werden, fließen in einen Online-Klassifikator ein. In einem Test hat sich gezeigt, dass Anthelion einen sehr viel größeren Anteil von Webseiten mit strukturierten Daten zurückliefert als ein normaler Crawler:Yahoo Anthelion liefert mehr Seiten mit strukturierten Daten zurück als normale Crawler

Bild "Architektur" und "Precision": Apache 2.0-Lizenz

Bei einer gewählten Linktiefe von 5 lag die Precision (der Anteil von relevanten zu nicht relevanten Treffern in der Ergebnismenge, also von Seiten mit strukturierten Daten vs. Seiten ohne diese Daten) bei 0,78. Zum Vergleich: Der Standard-Crawler schaffte gerade einmal eine Precision von 0,06.

Anthelion arbeitet mit Apache Nutch 1.6 zusammen. Nutch 1.x und Nutch 2.x sind derzeit noch zwei voneinander unabhängige Projekte. Ob Anthelion auch mit Nutch 2.x funktioniert, ist offen.

Weitere Informationen zu Anthelion gibt es in diesem PDF.

 


SEO-Checkliste

SEO-Checkliste

 

Anzeige

SEO-Beratung

Suchmaschinenoptimierung und SEO-Beratung für Karlsruhe, Baden und die Pfalz

 

06340/351-943

 

info(at)seo-suedwest.de

Bekannt aus

Website Boosting


Internet World Business

SEO United


The SEM Post


Webselling

Sprecher auf

Auszeichnungen

SEO Südwest: Platz 5 bei den SEO-Wahlen 2014 zum besten deutschen SEO-Blog

 

SEO-united.de Tipp 12/15

iBusiness Top-100-Liste SEO-Dienstleister

SEO Südwest English website

Jetzt vernetzen

SEO-Glossar

SEO-Glossar

 

SEO-Kalender 2016

SEO-Kalender 2015

 

SEO- und Suchmaschinenblogs

Werbung

SEO-Tipps und SEO-Tricks

IMAGE Der interne PageRank: eine der am meisten unterschätzten SEO-Kennzahlen
Sonntag, 24. April 2016
Die interne Verlinkung von Webseiten spielt eine bedeutende Rolle für das Ranking in Google und... Weiterlesen...
IMAGE Zu klein für Google Top-10: Yelp hilft
Montag, 19. Januar 2015
Für viele kleine Webseiten, die es aus eigener Kraft nicht schaffen, unter die Top-10 bei Google... Weiterlesen...
IMAGE Tipp: Reddit für den Aufbau von Backlinks nutzen
Samstag, 17. Januar 2015
Die Social-News-Plattform Reddit erlaubt den Aufbau von guten Backlinks - wenn man sich an... Weiterlesen...

News aus dem Blog

IMAGE Nur der KSC!
Montag, 01. Juni 2015
Schluss. Aus. Vorbei. Der KSC spielt auch in der kommenden Saison in der zweiten Liga. Einsatz,... Weiterlesen...
IMAGE SEO: Können 'Ausverkauft'-Seiten in Online-Shops positive Rankingeffekte haben?
Sonntag, 01. Februar 2015
Wie geht Google eigentlich mit Seiten aus Online-Shops um, die nicht mehr lieferbare Produkte... Weiterlesen...
IMAGE Vorsicht bei Verwendung von Stockfotos auf Facebook
Montag, 25. April 2016
Wer Bilder aus Foto-Archiven, sogenannten Fotostocks, verwendet, sollte aufpassen, wenn es um das... Weiterlesen...

 Eine Auswahl zufriedener Kunden

Rebel - Bad Küche Raum
Schöne Haare Karlsruhe
kr3m
feel-perfect.eu - Die Nährstoffexperten border=
Flintec IT GmbH
ESM Academy

Verbinden

Social Networks und RSS-Feed