15. August 2026 · Von YasKad
VectifyAI/PageIndex

PageIndex: Dokument-RAG, das Bäume statt Vektoren durchsucht

VectifyAI/PageIndex · 35.848★ · 3.158 forks

Alles Wichtige zu VectifyAI/PageIndex: ein hierarchischer Index, um Belege aus langen Dokumenten durch das Schlussfolgern eines Sprachmodells abzurufen, ohne dass eine Vektordatenbank vorausgesetzt wird.


Was PageIndex ist

PageIndex ist die Open-Source-Komponente von Vectify AI, um aus einem PDF oder Markdown einen baumförmigen Index zu erstellen und ihn für Retrieval-Augmented Generation (RAG) zu nutzen. Der Baum ähnelt einem angereicherten Inhaltsverzeichnis: Die Knoten enthalten Titel, Seitenbereich, Zusammenfassung und Kennung. Das Modell kann diese Struktur durchlaufen und konkrete Abschnitte abrufen, statt die Anfrage mit Vektoren von Textfragmenten zu vergleichen.

Das Konzept bedeutet nicht, dass kein Modell beteiligt ist: Die Analyse und die Erzeugung der Struktur nutzen ein Sprachmodell. „Ohne Vektoren” bedeutet, dass der veröffentlichte Ablauf weder Embeddings noch Ähnlichkeitssuche noch eine Vektordatenbank erfordert. Das README verortet den Anwendungsfall bei Finanzberichten, juristischen und regulatorischen Dokumenten, Handbüchern, medizinischer Literatur und umfangreichen Fachbüchern.

Es gibt drei verwandte Angebote: das selbst hostbare Repository, einen Cloud-Dienst mit verbessertem OCR und verbesserter Verarbeitung sowie PageIndex Chat. Die offizielle Website präsentiert außerdem eine Integration per MCP und API; die Unternehmensoptionen umfassen einen dedizierten Cluster oder eine private VPC-Bereitstellung.

Der Ursprung: eine Kritik daran, dass Ähnlichkeit nicht Relevanz bedeutet

Das Repository wurde am 1. April 2025 erstellt. Das README schreibt die technische Herleitung Mingtian Zhang, Yu Tang und dem PageIndex-Team zu und verlinkt eine Projektvorstellung vom September 2025. Diese Namen sind somit als Autoren der Präsentation dokumentiert, nicht notwendigerweise als das gesamte Gründungsteam.

Die Launch-Erzählung geht von einer konkreten Spannung mit vektorbasiertem RAG aus: Vectify AI vertritt die Ansicht, dass semantische Ähnlichkeit in langen professionellen Dokumenten keine kontextuelle Relevanz garantiert. Als erklärte Inspiration dient das Vorgehen eines erfahrenen Lesers: zuerst ein Inhaltsverzeichnis erstellen und danach über dessen Zweige nachdenken.

Die Diskussion auf Hacker News zeigt, dass diese These von Anfang an Interesse und Reibung auslöste. Im Launch-Thread vom August 2025 antwortete der Autor, dass der anfängliche Baumaufbau langsamer sein kann als der Vektoransatz und dass ein großer Baum den Abruf verlangsamen kann; das Design priorisiert Präzision vor Geschwindigkeit. Das ist eine vom Projekt selbst eingeräumte Einschränkung, kein Versprechen, Vektordatenbanken universell zu ersetzen.

Digitale Waage, die einen leuchtenden hierarchischen Baum, der Präzision und Struktur repräsentiert, mit einer schnellen Vektorwolke vergleicht, die Geschwindigkeit und Ähnlichkeit repräsentiert; die Waage neigt sich leicht zum Baum.

Philosophie und Prinzipien

Die verifizierbaren Prinzipien aus README und Dokumentation lassen sich so zusammenfassen:

  • Struktur vor künstlicher Fragmentierung: natürliche Abschnitte und ihre Hierarchie bewahren, statt Text ausschließlich nach Länge zu zerteilen.

Konzeptionelle Darstellung von „Struktur vor künstlicher Fragmentierung": Eine fortlaufende Rolle aus leuchtendem digitalem Text faltet sich organisch zu einer neonumrandeten Baumhierarchie, statt in willkürliche Abschnitte zerhackt zu werden.

  • Schlussfolgern vor Ähnlichkeit: einen hierarchischen Index durchlaufen, um zu entscheiden, welche Zweige relevante Belege enthalten.

Konzeptionelle Illustration von „Schlussfolgern vor Ähnlichkeit": Links navigiert ein leuchtendes KI-Gehirn durch einen Neon-Baumindex; rechts verblasst eine verstreute Ansammlung von Vektorpunkten, die durch chaotische Linien verbunden sind, in der Dunkelheit.

  • Nachvollziehbare Belege: explizite Verweise auf Abschnitte und Seiten zurückgeben, damit sich der Abruf überprüfen lässt.

Nahaufnahme eines leuchtenden Knotens im PageIndex-Baum, der eine holografische Karte mit Seitenzahl, Abschnittstitel und einer kurzen Zusammenfassung projiziert, als Darstellung nachvollziehbarer Belege.

  • Konversationskontext: Die Auswahl kann laut Projektdokumentation den Gesprächsverlauf und Fachwissen einbeziehen.
  • Wahl nach dem operativen Kompromiss: Das Projekt behauptet nicht, der Baum sei immer schneller. Der Autor erklärte auf HN, ein kleiner Baum könne effizient sein, während er für Geschwindigkeit vor Präzision eine Vektordatenbank empfiehlt.

Das Ergebnis ist eine Design-Alternative, kein unabhängiger Nachweis, dass jedes vektorbasierte RAG intransparent oder unterlegen sei. Die Zahl von 98,7 % bei FinanceBench stammt vom Projekt selbst und seinem Repository VectifyAI/Mafin2.5-FinanceBench; sie sollte als von Vectify AI veröffentlichtes Ergebnis gelesen werden, nicht als allgemeine externe Validierung.

Wie es funktioniert

Der dokumentierte lokale Ablauf hat zwei Phasen:

  1. Indexerzeugung: PageIndex verarbeitet das Dokument und erzeugt einen semantischen Baum. Bei einem PDF stellt die Ausgabedatei die Hierarchie, ihre Zusammenfassungen und Seitenbereiche dar. Es kann ein vorhandenes Inhaltsverzeichnis erkennen oder die Struktur aus dem Dokument aufbauen.
  2. Begründeter Abruf: Bei einer Frage untersucht ein Modell den Baum und folgt Zweigen, bis es die passenden Abschnitte findet. Die Begründung ist an Seiten und Knoten gebunden, statt sich auf einen Ähnlichkeitswert zu beschränken.

Geteiltes Bild: Links verwandelt sich ein PDF in einen semantischen Baum; rechts befragt ein KI-Agent diesen Baum und folgt einem leuchtenden Pfad die Zweige hinab bis zu einem konkreten Knoten.

Das Hauptprogramm ist run_pageindex.py. Es akzeptiert PDFs über --pdf_path und Markdown über --md_path; bei Markdown werden die Ebenen #, ## und weitere als Hierarchie interpretiert. Die Vorschau PageIndex Flash wird mit --flash aktiviert: Sie nutzt Heuristiken, um die Struktur zu extrahieren, und reserviert das Modell für die Zusammenfassungen; --optimize fügt einen zusätzlichen Verfeinerungsdurchlauf hinzu.

Das Repository enthält außerdem ein selbst gehostetes agentisches RAG-Beispiel mit dem OpenAI Agents SDK unter examples/agentic_vectorless_rag_demo.py sowie Notebooks für vektorloses RAG und visuelles RAG. Laut README arbeitet Letzteres mit Seitenbildern.

Darstellung eines agentischen Workflows ohne Vektordatenbank: Eine leuchtende Roboterhand zeigt auf die Zweige eines holografischen Inhaltsverzeichnisbaums und zieht leuchtende Seitenpaneele heraus.

Offizieller und halboffizieller Status

PageIndex ist ein offizielles Vectify-AI-Projekt: Das Repository liegt unter der Organisation VectifyAI, die Website und die Dokumentation präsentieren es als Vectify-AI-Produkt, und das README verlinkt die eigenen Chat-, MCP- und API-Dienste.

Es wurde kein Beleg dafür gefunden, dass PageIndex in einen offiziellen Marktplatz eines Modellanbieters aufgenommen wurde. MCP ist ein offener Integrationsstandard, keine Billigung durch Anthropic, OpenAI oder einen anderen Anbieter. In der Praxis erlauben der offizielle Server VectifyAI/pageindex-mcp und die offiziellen Anleitungen die Anbindung an Agenten, die MCP unterstützen; das belegt dokumentierte Kompatibilität, keine Leistungszertifizierung und keinen De-facto-Standard-Status.

Das Ökosystem

Repositories von Vectify AI

Die Abfrage der API der Organisation identifizierte folgende verwandte öffentliche Repositories; die Sterne entsprechen der Messung dieses Durchlaufs:

  • VectifyAI/pageindex-mcp — der MCP-Server von PageIndex für den Abruf per Baumsuche und Schlussfolgern; 377 Sterne.
  • VectifyAI/pageindex-js-sdk — TypeScript-SDK für die Dokumentverarbeitung von PageIndex; 7 Sterne.
  • VectifyAI/OpenKB — eine Wissensdatenbank für Sprachmodelle, die Dokumente zu einem verknüpften Wiki zusammenstellt; 3.261 Sterne.
  • VectifyAI/ChatIndex — Baumindexierung und -abruf für langes konversationelles Gedächtnis; 156 Sterne.
  • VectifyAI/ConDB — eine KV-Cache-native Kontextdatenbank für baumbasierten Abruf; 51 Sterne.
  • VectifyAI/Mafin2.5-FinanceBench — die FinanceBench-Auswertung für Mafin 2.5, von der Organisation als durch PageIndex angetrieben angegeben; 91 Sterne.
  • VectifyAI/MMLongBench-Doc-V2 — ein Repository für Dokumentenauswertung ohne Sterne in der abgefragten API-Antwort.

Abstrakte Darstellung des PageIndex-Ökosystems: ein zentraler leuchtender Baum, der über Datenströme mit Symbolen für Chat, Cloud-Server und API-Gateways verbunden ist, als Bezug zur MCP-Integration.

Das README führt OpenKB, ChatIndex, ConDB und PageIndex MCP explizit als Infrastruktur für lange Kontexte auf. Es behauptet nicht, dass sie zwingende Abhängigkeiten für die Ausführung von run_pageindex.py sind.

Ableger, Ports und Übersetzungen

Die Suche nach Repository-Namen fand VectifyAI/pageindex-mcp als direkt identifizierbaren Ableger. Auch osdotsystem/pageindex-open tauchte in einer HN-Einreichung vom Februar 2026 als offene Implementierung auf; sein README und seine GitHub-Metadaten wurden in diesem Durchlauf nicht erfasst, weshalb seine technische Beziehung, Pflege und Kennzahlen ungeprüft bleiben. Es wurden keine Übersetzungen oder Ports in anderen Sprachen als Englisch mit ausreichender Evidenz identifiziert, um sie als solche zu bezeichnen.

Zahlen zum Repo

Messung: 5. August 2026; öffentliche GitHub-API.

KennzahlWert
Sterne35.025
Forks3.070
Tatsächliche Abonnenten141
Commits357
Von der API gemeldete offene Issues146
HauptsprachePython
LizenzMIT
Erstellung1. April 2025
Letzter Code-Push4. August 2026
Letzte Metadaten-Aktualisierung5. August 2026
Letzte GitHub-Versionv0.3.0.dev3, 10. Juli 2026
Veröffentlichte PyPI-Version0.2.8

Die von der API zurückgegebenen Hauptmitwirkenden waren rejojer (233 Beiträge), zmtomorrow (68), BukeLy (23) und S3DFX-CYBER (16). Die Gesamtzahl von 357 Commits stammt vom Link zur letzten Seite der Commit-Paginierung von GitHub. open_issues_count kann offene Pull Requests einschließen. Ebenso dupliziert watchers_count hier die Sternezahl; deshalb gibt die Tabelle das eigenständige Feld subscribers_count als tatsächliche Abonnentenzahl an.

Wie man beiträgt

Im erfassten Wurzelverzeichnis gibt es weder eine CONTRIBUTING.md noch einen Beitragsleitfaden, weshalb sich kein offizieller Ablauf für Forks, Branches oder eine Pull-Request-Vorlage belegen lässt. Es gibt jedoch Verzeichnisse tests/ und .github/, und die sichtbaren Pull Requests zeigen technische Beiträge.

Der Pull Request #188 behob beispielsweise einen KeyError und eine Kontexterschöpfung bei der Verarbeitung von Dokumenten mit rund 800 Seiten; er fügte 14 simulierte Tests hinzu und wurde am 3. Juli 2026 zusammengeführt. Das zeigt, dass das Repository für wichtige Änderungen Tests verwendet, ersetzt aber keine veröffentlichte Beitragsrichtlinie.

Wie die Community reagierte

Die erfasste Resonanz ist erheblich und vor allem auf Hacker News konkret:

  • Die Einreichung 45036944, vorgestellt von page_index am 27. August 2025, erreichte 192 Punkte und 128 Kommentare. brap empfand den Navigationsprozess als natürlich und die Kosten für Indexierung und Suche für den eigenen Fall als akzeptabel. agentcoops schätzte, dass man sich für internes RAG mit mehr Rechenleistung eine vorhersehbar bessere Antwort erkaufen kann; das ist eine individuelle Meinung, kein Benchmark.
  • Im selben Thread wandte marcodena ein, Vektoren seien deutlich effizienter. mosselman fragte nach Latenz und Kosten bei vielen Suchanfragen und schlug Alternativen auf Basis von Vorab-Indexierung und BM25 vor. neya vertrat die Ansicht, der Ansatz könne sich für Hintergrundwarteschlangen eignen, jedoch nicht für nahezu sofortiges bedarfsgesteuertes RAG, angesichts des Kompromisses zwischen Geschwindigkeit, Präzision und Kosten.
  • ineedasername stellte infrage, die Bezeichnung „vektorlos” als Synonym für einen weniger genauen Ansatz zu verwenden: Nach einer Code-Durchsicht vertrat er die Ansicht, der Kernwert bestehe darin, ein Inhaltsverzeichnis durch iterative Modellaufrufe zu erzeugen und zu durchlaufen. gillesjacobs bat um Vergleiche mit gut abgestimmten hybriden Retrievern und merkte an, dass die Mafin-2.5-Auswertung eng gefasst sei. Das sind technische Kritikpunkte, die ihren jeweiligen Autoren zugeschrieben werden; eine unabhängige Auswertung, die sie klärt, wurde nicht gefunden.
  • Auf Reddit verzeichnet der Thread r/Rag: 1n1iqy3, veröffentlicht von CathyCCCAAAI am 27. August 2025, 127 Punkte und 57 Kommentare. Der Eröffnungsbeitrag lobt Transparenz und Nachvollziehbarkeit, ist aber Werbematerial, keine unabhängige Besprechung. Ein weiteres Ergebnis, r/LovingOpenSourceAI: 1t4il64, erreichte 52 Punkte und 41 Kommentare; Meinungen aus dessen Kommentaren werden hier nicht zugeschrieben, da sie nicht einzeln erfasst wurden.

Es wurden außerdem mehrere reichweitenschwache HN-Einreichungen zu PageIndex MCP gefunden. Die sichtbarste, 45482992, hatte 14 Punkte und 3 Kommentare. Das ist ein Signal für die Verbreitung des MCP-Add-ons, kein Beleg für massenhafte Akzeptanz.

Es wurden keine verifizierbaren Beiträge auf X gefunden, die eine konkrete Reaktion einem Konto zuordnen ließen, ebenso wenig eine Product-Hunt-Launch-Seite; die Product-Hunt-Suche lieferte keine Produkte für „PageIndex VectifyAI”. Die automatisierte YouTube-Suche lieferte eine technische Seite ohne erfassbare Titel und Aufrufzahlen, weshalb hier keine Tutorials oder Aufrufzahlen erfunden werden.

PageIndex im Vergleich zu anderen Ansätzen

AnsatzVerifizierbare BeziehungVerifizierbarer Unterschied oder Grenze
Vektorbasiertes RAG mit VektordatenbankRuft Kontext für ein Sprachmodell ab und ist der explizite Kontrastpunkt des READMEs.PageIndex strukturiert einen Baum und nutzt baumbasiertes Schlussfolgern; der Vektoransatz ruft nach Ähnlichkeit ab. Der Autor selbst weist darauf hin, dass die Vektoroption vorzuziehen sein kann, wenn Geschwindigkeit Priorität hat.
GraphRAGagentcoops verglich es im Thread 45036944 als RAG-Alternative mit Vorverarbeitung.Der Vergleich von Kosten und Skalierbarkeit ist die Meinung des Kommentators, kein erfasster Benchmark.
neuml/txtaiSein Autor, dmezzetti, nannte es im Thread als leichtgewichtige Abrufoption, die keine separate Vektordatenbank erfordert.Die Quelle erlaubt weder den Schluss auf funktionale Gleichwertigkeit noch eine Leistungsmessung gegenüber PageIndex.
datalab-to/markerleetharris empfahl es in der Diskussion für die selbst gehostete Dokumentextraktion.Es bezieht sich auf Dokumentextraktion, nicht auf einen direkten Konkurrenten für begründeten Abruf; es sollte nicht mit einem vollständigen RAG-System verwechselt werden.

Kurzanleitung zur Nutzung

Installation und erster lokaler Start

Das README veröffentlicht den folgenden minimalen Ablauf:

git clone https://github.com/VectifyAI/PageIndex.git
cd PageIndex
pip3 install --upgrade -r requirements.txt

Legen Sie im Root-Verzeichnis eine .env-Datei an und fügen Sie einen mit LiteLLM kompatiblen Modellschlüssel hinzu; das offizielle Beispiel verwendet:

OPENAI_API_KEY=your_openai_key_here

Führen Sie danach aus:

python3 run_pageindex.py --pdf_path /pfad/zum/dokument.pdf

Das erste erwartete Ergebnis ist eine Baumstruktur des Dokuments. Für Markdown lautet der entsprechende offizielle Befehl:

python3 run_pageindex.py --md_path /pfad/zum/dokument.md

Gängige Arbeitsabläufe

  1. Einen PDF-Bericht indexieren: Führen Sie python3 run_pageindex.py --pdf_path /pfad/bericht.pdf aus; nutzen Sie den erzeugten Baum, um Titel, Knoten, Zusammenfassungen und Seitenbereiche zu prüfen.

  2. Strukturextraktion beschleunigen: Führen Sie python3 run_pageindex.py --flash --pdf_path /pfad/bericht.pdf aus. Fügen Sie --optimize hinzu, wenn Sie einen zusätzlichen Verfeinerungsdurchlauf mit dem Modell wünschen.

  3. Das selbst gehostete agentische Beispiel ausführen: Installieren Sie die optionale Abhängigkeit und starten Sie das offizielle Beispiel:

    pip3 install openai-agents
    python3 examples/agentic_vectorless_rag_demo.py
  4. Den gehosteten Dienst integrieren: Erstellen Sie im Entwickler-Dashboard einen Schlüssel, laden Sie das Dokument hoch und verarbeiten Sie es, und wählen Sie MCP, damit Ihr eigener Agent PageIndex als Werkzeug aufruft, oder die Chat-API, um Antworten des von PageIndex gehosteten Modells zu erhalten.

Wesentliche Konfiguration

  • .env: speichert den Schlüssel des Modellanbieters für die lokale Ausführung.
  • --model: wählt das Modell aus; der dokumentierte Standardwert ist gpt-4o-2024-11-20.
  • --toc-check-pages: begrenzt, wie viele Seiten auf ein Inhaltsverzeichnis hin geprüft werden; Standard: 20.
  • --max-pages-per-node: begrenzt Seiten pro Knoten; Standard: 10.
  • --max-tokens-per-node: begrenzt Tokens pro Knoten; Standard: 20.000.
  • --if-add-node-id, --if-add-node-summary und --if-add-doc-description: aktivieren oder deaktivieren Kennungen, Zusammenfassungen und Dokumentbeschreibung; alle standardmäßig auf yes gesetzt.

Häufige Stolperfallen und Lösungen

  • Automatisch aus PDF oder HTML konvertiertes Markdown: Das README rät von --md_path ab, wenn die Konvertierung die Hierarchie nicht bewahrt hat. Da der Markdown-Modus Ebenen aus # ableitet, erzeugt eine fehlerhafte Struktur einen fehlerhaften Baum. Die dokumentierte Alternative besteht darin, das PDF zu verarbeiten oder Markdown zu beschaffen, das die Hierarchie bewahrt.
  • Komplexes oder gescanntes PDF: Das Repository nutzt Standard-PDF-Analyse. Vectify AI gibt an, dass sein Cloud-Dienst verbessertes OCR, Baumaufbau und Abruf bietet; das ist der dokumentierte Weg, wenn die lokale Extraktion nicht ausreicht.
  • Sehr große Dokumente: Der zusammengeführte Pull Request #188 behob Kontextfehler bei Dokumenten mit rund 800 Seiten. Aktualisieren Sie auf eine Version, die diese Korrektur enthält, und testen Sie mit der Größe und dem Modell Ihrer eigenen Umgebung.
  • Universell niedrige Latenz erwarten: HN verzeichnet nachvollziehbare Einwände zu Kosten und Skalierung. Der Autor selbst erklärt, dass große Bäume langsamer sein können; messen Sie die Kosten für Indexierung und Abfrage anhand Ihres eigenen Korpus, bevor Sie einen bestehenden Vektor-Retriever ersetzen.

Integrationen und Migration

Das Repository liefert ein Beispiel mit dem OpenAI Agents SDK; der offizielle Dienst bietet MCP und eine API. MCP erlaubt kompatiblen Agenten oder Frameworks, einschließlich solcher, die laut Dokumentation LangChain oder das OpenAI Agents SDK verwenden, PageIndex als Werkzeug aufzurufen, ohne eine spezifische manuelle Integration.

Es wurde kein offizieller Migrationsleitfaden von oder zu LangChain, LlamaIndex, GraphRAG oder einer Vektordatenbank gefunden. Der vorsichtige Migrationsweg besteht darin, beide Retriever über denselben Satz von Anfragen laufen zu lassen und Latenz, Kosten, Nachvollziehbarkeit und Genauigkeit in der eigenen Domäne zu vergleichen; diese Empfehlung ist eine operative Analyse, kein offizielles PageIndex-Verfahren.

Anwendungsfälle und wem dieses Repository helfen kann

  • Teams aus Finanzen, Compliance oder Recht, die mit Berichten, aufsichtsrechtlichen Einreichungen und langen Verträgen arbeiten, können einen Baum mit Seitenbereichen erzeugen und nachvollziehbare Belege für ihre Antworten bewahren. Das README nennt ausdrücklich Finanzberichte sowie juristische und regulatorische Dokumente.
  • Entwickler von Dokumentenagenten können den Dienst per MCP mit einem Agenten verbinden oder das Beispiel des OpenAI Agents SDK wiederverwenden, sodass der Abruf zu einem Werkzeug innerhalb einer agentischen Sequenz wird.
  • Teams, die nachvollziehen müssen, warum eine Passage abgerufen wurde, können von Knoten, Zusammenfassungen und Seitenverweisen profitieren, statt eine Liste ähnlichkeitsbasierter Fragmente ohne sichtbare Hierarchie zu akzeptieren.
  • Nutzer mit einfachen PDFs oder gut strukturiertem Markdown können den lokalen Ablauf mit run_pageindex.py ausprobieren; wer komplexe Scans oder Anforderungen an eine private Bereitstellung hat, sollte den OCR-Dienst und die von Vectify AI dokumentierten Unternehmensoptionen prüfen.
  • Teams mit hohem Anfragevolumen oder strikten Latenzanforderungen sollten nicht annehmen, dass PageIndex eine Vektordatenbank ersetzt: Die erfassten Kommentare und die Antwort des Autors selbst nennen Kosten und Latenz als relevante Kompromisse.

Ressourcen


Hinweis: Dieser Artikel kombiniert das README, die Dokumentation und die offizielle Website von PageIndex, die öffentliche GitHub-API, PyPI, Hacker News und Reddit-Ergebnisse, die am 5. August 2026 erfasst wurden. Zahlen und Verfügbarkeit ändern sich mit der Zeit.

Kommentare