Methodik

So fasst text-zusammenfassen.de Texte zusammen

Diese Seite erklärt ehrlich, wie die TextRank-Engine arbeitet und wie aus deinem Text eine extraktive Zusammenfassung wird. Jede Berechnung läuft komplett lokal im Browser, ohne Server, ohne KI-API, ohne Tracking der Inhalte.

Extraktiv, nicht generativ

text-zusammenfassen.de ist ein extraktiver Summarizer: das Tool wählt die wichtigsten Sätze aus deinem Originaltext aus und stellt sie zusammen. Es schreibt die Sätze nicht um und generiert keinen neuen Text wie GPT, Claude oder Gemini. Der Vorteil ist Genauigkeit (keine erfundenen Fakten, keine Halluzinationen) und Privatsphäre (kein API-Call). Der Nachteil ist Stil (die Zusammenfassung liest sich wie ein gekürzter Originaltext, nicht wie eine neu formulierte Variante).

Anzeige

TextRank-Algorithmus

Die Engine implementiert TextRank von Rada Mihalcea und Paul Tarau aus ihrem EMNLP-2004-Paper TextRank: Bringing Order into Texts. Der Algorithmus ist eine direkte Adaption von Google PageRank (Sergey Brin und Larry Page, 1998) auf Sätze statt Webseiten. Statt Hyperlinks bekommt jeder Satz eine Similarity-Verbindung zu jedem anderen Satz im Text, gewichtet nach den gemeinsamen Wörtern.

Sentence-Splitting

Der Eingabetext wird zuerst preprocessiert (Whitespace-Normalisierung, maximal zwei Zeilenumbrüche hintereinander). Dann splittet ein regulärer Ausdruck den Text nach Punkt, Ausrufezeichen oder Fragezeichen, gefolgt von Whitespace und einem Großbuchstaben oder einem Zitat-Anführungszeichen. Vor dem Split werden deutsche Abkürzungen wie z.B., d.h., u.a., usw., bzw., ggf., ca., Dr., Prof. mit einem Platzhalter maskiert, damit der Punkt innerhalb der Abkürzung nicht fälschlich als Satzende erkannt wird. Nach dem Split werden die Platzhalter wieder zurückgesetzt.

Tokenisierung und Stoppwortfilter

Jeder Satz wird tokenisiert: lowercased, Satzzeichen entfernt, an Whitespace gesplittet, Wörter unter drei Buchstaben verworfen. Anschließend wird gegen eine Stoppwortliste gefiltert. Für Deutsch sind das rund 100 Wörter (die, der, und, ist, ein, eine, nicht, von etc.), für Englisch rund 110 (the, and, is, are, a, an, of etc.). Wer einen englischen Text einreicht, wählt im Sprach-Select English, damit die passende Liste greift.

Similarity-Matrix

Für jedes Satzpaar berechnet die Engine eine Similarity. Wir nutzen die Mihalcea-Tarau-Formel aus dem Original-Paper:

sim(s_i, s_j) = |gemeinsame Tokens| / (log|tokens_i| + log|tokens_j|)

Der Logarithmus im Nenner ist die Strafkomponente: lange Sätze, die viele Wörter teilen, bekommen nicht automatisch höhere Werte als kurze Sätze mit denselben Kernwörtern. Die Similarity-Werte landen in einer symmetrischen Matrix M, in der M[i][j] die Ähnlichkeit von Satz i zu Satz j enthält. Die Diagonale bleibt null (ein Satz ist sich selbst nicht ähnlich für den Zweck der Ranking-Bewertung).

PageRank-Iteration

Auf der Similarity-Matrix läuft jetzt PageRank, wie Brin und Page 1998 in The Anatomy of a Large-Scale Hypertextual Web Search Engine beschrieben. Die Iteration lautet:

score[i] = (1 - d) / n + d * sum_j (M[i][j] / colSum[j]) * score[j]

Mit Damping-Faktor d = 0.85 (Standardwert seit Brin/Page), Iteration bis zur Konvergenz mit Toleranz 1e-5 oder maximal 50 Iterationen. colSum[j] ist die Spaltensumme der Matrix, also die Gesamtwichtigkeit die Satz j auf andere Sätze überträgt. Bei symmetrischen Similarity-Matrizen konvergiert PageRank in weniger als 20 Iterationen.

Auswahl und Reihenfolge

Nach der Iteration sind alle Sätze nach Score sortiert. Aus der Längen-Wahl ergibt sich der Retention-Wert: 30 Prozent bei Kurz, 50 Prozent bei Mittel, 70 Prozent bei Lang. Die Top-N höchstgerankten Sätze werden in ihrer Original-Reihenfolge wieder zusammengesetzt (nicht in Score-Reihenfolge), damit der Lesefluss erhalten bleibt. Die drei höchstgerankten Sätze werden zusätzlich als Kernaussagen separat angezeigt.

Output-Formate

  • Fließtext: Sätze werden mit Leerzeichen verbunden, wie ein gekürzter Artikel.
  • Stichpunkte: Jeder Satz bekommt ein Bullet-Symbol als Präfix.
  • Nummerierte Liste: Sätze werden mit "1.", "2.", "3." durchnummeriert.

TXT-Export

Der Download exportiert den Originaltext plus die Zusammenfassung in einer TXT-Datei mit UTF-8 Byte-Order-Mark, damit Microsoft Excel und LibreOffice Calc die Umlaute beim Import korrekt rendern. Der Dateiname enthält den ISO-Zeitstempel des Generierens.

Datenschutz und Privatsphäre

Die gesamte Berechnung läuft im Browser über JavaScript. Eingegebene Texte werden nicht an unsere Server übertragen, nicht gespeichert und nicht an Dritte weitergegeben. Wer den Tab schließt und localStorage leert, hinterlässt keine Spuren. Details im Datenschutz.

Was nicht im Tool ist

Bewusst weggelassen: PDF-Upload (würde Server-OCR oder Browser-PDF-Parsing verlangen, sprengt das client-only-Pattern), abstraktive Generierung (würde GPT-API-Call mit OPENAI_API_KEY auf einem Server brauchen, kollidiert mit DSGVO und der no-tracking-Promise), Multi-File-Batch (Scope-Creep). Wer abstraktive Summarization mit Sätzen-Umformulieren braucht, ist bei Claude, ChatGPT oder Gemini besser aufgehoben. Die kosten aber Account, API-Key oder Abo.

Korrektur-Policy

Wenn dir ein Bug auffällt, etwa falsch erkannte Satzgrenzen bei englischen Abkürzungen, kaputte UTF-8-Encoding im TXT-Export oder eine inhaltliche Unstimmigkeit in einem Ratgeber, schreib an info@akara-solutions.de. Bestätigte Korrekturen dokumentieren wir öffentlich auf Korrekturen.

Verantwortung

Für die Engine und ihre redaktionelle Pflege sind Mateusz Viola (TextRank-Engine, Stopwords, Format-Output), Jan-Tristan Rudat (Summarization-Historie, NLP-Recherche) und Eike-Christian Ramcke (DSGVO, UrhG, EU AI Act) zuständig. Inhaltlich Verantwortlicher gem. § 18 Abs. 2 MStV ist Eike-Christian Ramcke, Geschäftsführer der AKARA Solutions GmbH (vollständige Angaben im Impressum).

Quellen

  • Rada Mihalcea, Paul Tarau: TextRank: Bringing Order into Texts. Proceedings of EMNLP 2004, Barcelona. Originalveröffentlichung des Algorithmus. aclanthology.org/W04-3252
  • Sergey Brin, Larry Page: The Anatomy of a Large-Scale Hypertextual Web Search Engine. Computer Networks and ISDN Systems, 30 (1-7), 1998. Originaldefinition von PageRank inklusive Damping-Faktor 0.85.
  • Hans Peter Luhn: The Automatic Creation of Literature Abstracts. IBM Journal of Research and Development, 2:2, 1958. Erste computerbasierte Zusammenfassung der NLP-Geschichte.
  • Güneş Erkan, Dragomir R. Radev: LexRank: Graph-based Lexical Centrality as Salience in Text Summarization. JAIR 22, 2004. Paralleles Paper zu TextRank mit Cosine-Similarity.
  • Inderjeet Mani: Automatic Summarization. John Benjamins Publishing, 2001. Standardwerk zur klassischen extraktiven Summarization.
  • IETF: RFC 3629, UTF-8, a transformation format of ISO 10646. November 2003. Spezifiziert Byte-Order-Mark und Encoding für den TXT-Export.
Anzeige
Anzeige
Anzeige
Anzeige