Der Prozess

So bereitet Aparavi Ihre Daten für KI vor - ohne KI

Sechs Schritte, mit denen Ihre Datenlandschaft erfasst, strukturiert und auf das Relevante reduziert wird - regelbasiert und jederzeit nachvollziehbar. KI kommt erst danach gezielt zum Einsatz, in Ihrer eigenen Infrastruktur.

Scan

Aparavi erfasst Ihre Quellsysteme - etwa SharePoint, S3 oder Netzlaufwerke (SMB) - read-only: Ihre Produktivsysteme bleiben unverändert, die Daten bleiben an ihrem Speicherort.

  • Sie müssen vorab nicht wissen, was wo liegt: Der Scan bindet gängige Quellsysteme an, Aparavi erkennt 1.600+ Dateitypen. Insgesamt stehen 50+ Integrationen bereit.
  • Einstieg ohne Inhaltszugriff möglich: Zunächst werden nur Dateieigenschaften wie Name, Größe und Alter erfasst - das kommt Datenschutz- und Betriebsratsprüfungen entgegen.

Index & Inventar

Die erfassten Metadaten fließen in eine zentrale Index-Datenbank in Ihrem Rechenzentrum zusammen: ein durchsuchbares Inventar Ihrer Datenlandschaft mit Ablageort, Alter und - soweit in den Metadaten vorhanden - Verantwortlichkeit.

  • Bestandsfragen recherchieren Sie direkt im Index statt per Rundmail.
  • Das Inventar ist zugleich Grundlage für Governance, Migrationen, Wissensgraphen (Knowledge Graphs) und KI-Vorhaben.

Bewerten & Reduzieren

Veraltete, doppelte und für den Anwendungsfall ungeeignete Daten werden regelbasiert erkannt und sichtbar gemacht. Nach von Ihnen festgelegten Regeln werden sie von der weiteren Verarbeitung ausgeschlossen - der Bestand wird auf die relevanten Informationen reduziert, bevor die inhaltliche Analyse beginnt.

  • Jede Regel ist nachvollziehbar: Sie können prüfen, warum eine Datei ein- oder ausgeschlossen wurde.
  • Die relevantesten Daten können zuerst verarbeitet werden - bereits auf Basis des Metadaten-Scans.
  • Kennzahlen wie ursprüngliche Datenmenge, Reduktionsquote und Verarbeitungsaufwand werden gemeinsam mit Ihnen erhoben.

AI Collections bauen (in Entwicklung)

Eine AI Collection ist eine benannte, wiederholbar erzeugbare Auswahl von Dateien aus dem Index - zusammengestellt für einen Anwendungsfall und in Ihr Zielsystem exportierbar. Die Funktion ist in Vorbereitung und noch nicht produktionsreif.

  • Sensible Inhalte können vor der Übergabe bereinigt, anonymisiert oder pseudonymisiert werden (ab Stufe Wachstum).

Übergabe & Export

Übergabe an Ihr Zielsystem: Exportiert werden die Textinhalte der ausgewählten Dateien - sensible Informationen wie personenbezogene Daten können dabei unkenntlich gemacht werden (ab Stufe Wachstum). Kuratierte Daten heißt: ausgewählt, geprüft und, wo nötig, um sensible Inhalte bereinigt. Sie bleiben unabhängig in Ihrer Toolwahl: Aparavi liefert die Datenbasis, nicht die KI.

  • Unterstützte Vektor-Datenbanken: Chroma, Milvus, Pinecone, Qdrant, Weaviate oder Postgres.
  • Erst jetzt kommt KI zum Einsatz - gezielt, auf der reduzierten Datenbasis, in Ihrer Umgebung.

Kontinuierlich aktuell

Automatische, zeitgesteuerte Rescans aktualisieren den Index - aus der einmaligen Bestandsaufnahme wird ein regelmäßig aktualisiertes Abbild Ihrer Datenlandschaft.

  • Rescans erkennen neue, geänderte, verschobene und gelöschte Dateien.
  • Auch nachgelagerte Systeme lassen sich automatisch oder teilautomatisiert mitaktualisieren.