Documentation Index

Fetch the complete documentation index at: https://help.foxbase.de/llms.txt

Use this file to discover all available pages before exploring further.

Data Embedding & Vektor Datenbasis

Prev Next

Was passiert beim Upload von PDFs oder anderen Dateien?

Wenn PDFs, Excels oder andere unterstützte Datenquellen über APIs hochgeladen werden, verarbeitet das Data-Embedding-System diese Inhalte, damit sie später für Fragen nutzbar sind.

1. Inhalte werden eingelesen

  • Zuerst wird der Inhalt des Dokuments extrahiert. Bei einem PDF bedeutet das, dass der enthaltene Text ausgelesen und für die weitere Verarbeitung vorbereitet wird.

2. Das Dokument wird in Data Chunks aufgeteilt

  • Anschließend wird der Inhalt in kleinere Textabschnitte zerlegt. Diese Abschnitte werden häufig Chunks oder Data Chunks genannt.

  • Ein Chunk ist also ein kleiner, inhaltlich zusammenhängender Teil eines Dokuments. Das ist wichtig, weil eine KI später nicht immer ein komplettes PDF benötigt, sondern nur die relevantesten Abschnitte.

  • Dokumente werden bei der Aufnahme in handhabbare Chunks zerlegt, damit relevante Textstellen später effizient abgerufen werden können.

3. Die Chunks werden in Embeddings umgewandelt

  • Danach werden die Text-Chunks in sogenannte Embeddings umgewandelt.

  • Ein Embedding ist eine numerische Repräsentation eines Textes. Dadurch kann das System Bedeutungsähnlichkeiten erkennen. Es sucht dann nicht nur nach exakten Wörtern, sondern auch nach semantisch passenden Inhalten.

  • Ein Chunk zu „Laptop für Design und Reisen“ kann dadurch auch dann gefunden werden, wenn ein Nutzer anders fragt, zum Beispiel „Welches Gerät eignet sich für mobile Kreativarbeit?“.

  • AWS dokumentiert, dass Chunks in Embeddings umgewandelt und in einen Vektorindex geschrieben werden, damit Abfragen anhand semantischer Ähnlichkeit mit den Dokumentinhalten verglichen werden können.

4. Die Embeddings werden in einer Vektor-Datenbasis gespeichert

  • Die erzeugten Embeddings werden in einem Vektorindex oder einer Vektor-Datenbank gespeichert.

  • Dort liegen nicht einfach nur Dateien, sondern semantisch durchsuchbare Repräsentationen der Inhalte. Gleichzeitig bleibt die Verknüpfung zum Ursprungsdokument erhalten. Das ist wichtig, damit später nachvollziehbar ist, aus welchem Dokument ein gefundener Inhalt stammt.

  • Das Embedding ist aus Datenschutzgründen der wichtigste Teil, da hier entschieden wird, wo die Daten liegen und ob die Daten für das Training der allgemeinen Modelle benutzt werden oder nicht.

💡 Das Embedding ist bzgl. Datenschutzgründen der wichtigste Teil

  • Hier wird entschieden, wo die Daten liegen und ob die Daten für das Training der allgemeinen Modelle benutzt werden oder nicht.

  • Bei FoxBase kannst du verschiedene embedding Modelle benutzen, vor allem die, welche dir 100% DSGVO und EU AI Compliance bieten.

Was ist eine Vektor-Datenbasis?

  • Eine Vektor-Datenbasis speichert Inhalte nicht nur als normalen Text, sondern zusätzlich als Embeddings.

  • Embeddings sind mathematische Repräsentationen der Bedeutung eines Inhalts.

  • Beim Vergleich dieser Embeddings berechnet das System einen semantischen Ähnlichkeitswert, der zeigt, wie nah zwei Inhalte in ihrer Bedeutung beieinanderliegen.

  • So kann zum Beispiel die Formulierung „mobile Kreativarbeit“ einen hohen semantischen Ähnlichkeitswert zu einer Anfrage wie „Laptop für Design unterwegs“ haben, obwohl nicht dieselben Wörter verwendet werden.

  • Dadurch kann eine KI Inhalte nicht nur über exakte Begriffe, sondern auch über semantische Ähnlichkeit finden.

  • Inhaltlich ähnliche Texte liegen dabei im Vektorraum näher beieinander als inhaltlich unähnliche Texte.

  • Das ist die technische Grundlage für semantische Suche in dokumentenbasierten KI-Systemen.

Beispiel:

  • Ein Dokument enthält den Satz „Dieses Gerät eignet sich für mobile Kreativarbeit.“

  • Ein Nutzer fragt nach „einem Laptop für Design unterwegs“.

  • Eine klassische Keyword-Suche würde diesen Inhalt möglicherweise nicht finden.

  • Eine Vektor-Datenbasis kann beide Formulierungen über ihre ähnliche Bedeutung miteinander verknüpfen.

Was passiert, wenn ein Nutzer eine Frage stellt?

Wenn ein Nutzer eine Frage eingibt, passiert im Hintergrund typischerweise Folgendes:

1. Die Frage wird semantisch interpretiert

Das System analysiert nicht nur einzelne Suchbegriffe, sondern versucht die Bedeutung der Anfrage zu erfassen.

2. Passende Chunks werden gesucht

Die Frage wird mit den gespeicherten Embeddings verglichen. Danach werden die Text-Chunks aus der Wissensbasis zurückgegeben, die zur Anfrage am besten passen.

Bei Amazon Bedrock entspricht das dem Retrieval-Schritt: Die relevantesten Chunks aus den Datenquellen werden zur Anfrage abgerufen.

3. Ein Sprachmodell erzeugt daraus eine Antwort

Erst danach kommt das LLM ins Spiel.

Das ausgewählte Sprachmodell erhält:

  • die Nutzerfrage

  • die gefundenen relevanten Chunks

  • gegebenenfalls zusätzliche Regeln aus dem Prompt

Auf dieser Basis formuliert das Modell eine natürliche Antwort.

Dieser kombinierte Ablauf wird als „Retrieve and Generate“ beschrieben: Erst werden relevante Inhalte aus der Wissensbasis geholt, dann wird mit einem LLM eine Antwort erzeugt.

Du möchtest mehr über die Funktionsweise von KI und deren LLMs erfahren? Dann lies dir den nächsten Artikel durch. Alternativ kannst du direkt mit den Einstellung im FoxBase System starten.

FAQs

Was ist der Vorteil der FoxBase KI?

  1. FoxBase verbindet dokumentenbasierte KI, semantische Suche und Human in the Loop.

  2. So arbeitet die KI nicht nur mit allgemeinem Modellwissen, sondern mit eurem Unternehmenswissen und lernt zusätzlich durch menschliches Feedback.

  3. Das Ergebnis sind präzisere Antworten, besseres Kontextverständnis und eine KI, die sich an eure Prozesse und Begriffe anpasst.

Dadurch kann sie:

  • unternehmensspezifische Begriffe besser verstehen

  • interne Prozesse erklären

  • Produktwissen aus Dokumenten verwenden

  • Antworten näher an eurer Datenlage formulieren

  • Änderungen in Dokumenten schneller nutzbar machen als ein komplett neues Modelltraining

Was ist eine semantische Suche?

Semantische Suche ist eine Suchmethode, die nicht nur nach exakten Wörtern sucht, sondern nach der inhaltlichen Bedeutung einer Anfrage. Dadurch kann die KI auch dann passende Inhalte finden, wenn in der Frage andere Begriffe verwendet werden als im Dokument.

Eine Keyword-Suche würde zum Beispiel nur nach dem Wort „Laptop“ suchen, während eine semantische Suche auch Inhalte wie „mobiles Arbeitsgerät für Kreativaufgaben“ als passend zur Suchanfrage “Laptop für Design und lange Reisen” erkennen kann. So hilft semantische Suche dabei, relevantere Dokumente und Textabschnitte zu finden.

Das bedeutet:

Die KI beantwortet Fragen nicht nur aus allgemeinem internationalem Modellwissen, sondern zusätzlich auf Basis der Inhalte, die vorher aus PDFs oder anderen Datenquellen eingelesen und über eine semantische Suche als relevant gefunden wurden.

Warum die semantische Suche derzeit alles verändert?

  • Semantische Suche ist leistungsstärker als Keyword-Suche, weil sie Bedeutung statt nur Wörter vergleicht.

  • Sie findet deshalb häufiger die richtigen Inhalte, auch wenn Nutzer natürlich sprechen, Synonyme verwenden oder eine Frage anders formulieren.

  • Das ist besonders wichtig für KI-Chats und dokumentenbasierte Systeme, weil relevante Inhalte nicht immer exakt so geschrieben sind wie die Anfrage.

  • Eine Keyword-Suche ist gut bei klaren Schlagwörtern, stößt aber schnell an Grenzen, wenn Sprache variiert.

  • Semantische Suche ist deshalb besser geeignet, um aus großen Datenmengen die inhaltlich passenden Treffer zu finden.

Was ist ein LLM?

LLM steht für Large Language Model.

Ein LLM ist ein Sprachmodell, das Texte verstehen, zusammenfassen, umformulieren und neu generieren kann. Es ist der Teil des Systems, der die finale Antwort formuliert.

Wichtig ist:
Das LLM ist nicht automatisch die Wissensbasis selbst. Es ist vielmehr die Instanz, die mit der Frage und den gefundenen Dokumentinhalten arbeitet.

Deshalb besteht eine dokumentenbasierte KI meistens aus zwei Ebenen:

  • Wissensbasis / Retrieval

  • Sprachmodell / Antwortgenerierung

Warum kann man verschiedene LLMs auswählen?

In vielen KI-Systemen kann ausgewählt werden, welches Modell für den Chat verwendet werden soll.

Der Grund dafür ist, dass verschiedene Modelle unterschiedliche Stärken haben, zum Beispiel:

  • bessere Textqualität

  • schnellere Antwortzeiten

  • stärkerer Fokus auf Zusammenfassung

  • bessere Strukturierung

  • andere Kosten oder Performance-Eigenschaften

Amazon Bedrock ist genau dafür ausgelegt: Es stellt Foundation Models verschiedener Anbieter bereit, die je nach Bedarf ausgewählt und ausgetauscht werden können.

Welche Rolle spielt das Embedding Modell im zusammenhang mit dem LLM?

Wenn das embedding auf AWS, OpenAI oder ähnlichen basieren, dann übernehmen diese Anbieter typischerweise Teile der KI-Infrastruktur.

Dazu können gehören:

  • Verarbeitung von Wissensquellen

  • Chunking von Dokumenten

  • Erzeugung von Embeddings

  • Verwaltung oder Anbindung eines Vektorindex

  • Abruf relevanter Chunks

  • Nutzung eines auswählbaren Foundation Models zur Antwortgenerierung

Das embedding ist aus Datenschutzgründen der wichtigste Teil, da hier entschieden wird wo die Daten liegen und ob die Daten für das Training der allgemeinen Modelle benutzt werden.

FoxBase hat eine strikte DSGVO Orientierung, sodass du bei Auswahl des LLMs sowie des embedding keine Sorgen machen musst, dass deine Daten zum Allgemeinem Training oder anderweitig missbraucht werden.

Was ist der Unterschied zwischen allgemeinem KI-Wissen und dokumentenbasierter KI?

Ein allgemeines Sprachmodell kennt viele allgemeine Muster aus seinem Training. Es kennt aber nicht automatisch eure internen Prozesse, Produktlogiken oder Dokumente.

Eine dokumentenbasierte KI ergänzt das Sprachmodell deshalb um den wichtigsten Teil.

Kurz gesagt:

  • LLM allein = kann Sprache gut verarbeiten

  • LLM plus Wissensbasis = kann Sprache auf Basis eurer Dokumente anwenden

Warum werden Dokumente in Chunks und nicht als ganzes verarbeitet?

Ein komplettes Dokument ist oft zu groß, zu allgemein oder enthält zu viele Themen gleichzeitig.

Chunks haben mehrere Vorteile:

  • relevante Abschnitte lassen sich gezielter finden

  • Antworten basieren auf kleineren, präziseren Textstellen

  • die semantische Suche wird genauer

  • verschiedene Abschnitte eines Dokuments können unabhängig voneinander gefunden werden

Deshalb ist Chunking ein zentraler Bestandteil moderner RAG-Systeme und auch in Amazon Bedrock Knowledge Bases fest vorgesehen.