Lernmodul 7 Min Lesezeit 15. September 2026 Smart not Hard

Was ein RAG-Chatbot ist — in einfachen Worten

Warum ein RAG-Chatbot weniger liest als ein Upload — und darum alles kennt.

Video-Vorschau: Was ein RAG-Chatbot ist — in einfachen Worten

YouTube-Video wird erst beim Klick geladen · cookie- & trackingfrei bis zur Interaktion

In der letzten Lektion ging es darum, wo etwas hingehört, bevor du es eintippst. Dabei fiel ein Satz, der offen geblieben ist: Es gibt zwei Wissensablagen — eine, auf die auch eine Cloud-KI zugreift, und eine zweite, die nur das lokale Modell durchsucht. Dieser Artikel schaut sich die zweite an.

Und er fängt nicht mit einer Anleitung an, sondern mit einem Missverständnis. Es klingt harmlos und blockiert trotzdem alles Weitere: «Ich lade meine Dokumente hoch, und dann lernt das Modell sie.» Das tut es nicht. Solange dieses Bild im Kopf steht, ergibt der ganze Rest keinen Sinn.

Du bekommst hier das mentale Modell dahinter: warum ein Sprachmodell im Betrieb nichts dazulernt, aus welchen drei Teilen so ein Chatbot besteht, was er anders macht als eine Suche nach Wortgleichheit — und was er ehrlich kostet. Kein Aufsetzen, keine Kommandozeile. Das kommt später.

Dein Modell lernt nichts dazu — es bekommt vorgelegt

Die verbreitete Vorstellung lautet: Dokumente rein, Modell schlauer. So funktioniert es nicht. Ein Sprachmodell lernt im laufenden Betrieb nichts dazu. Was du ihm gibst, bekommt es vorgelegt — und zwar bei jeder einzelnen Frage neu.

Das ist kein Detail, sondern der Grund für alles Weitere. Denn was vorgelegt wird, muss in ein Fenster passen. Dieses Fenster heisst Kontextfenster, und es ist kleiner, als die meisten annehmen.

Bei Ollama liegt das Kontextfenster standardmässig bei 4096 Token. Das entspricht grob sechs bis acht A4-Seiten Text.

Der Wert lässt sich ändern. Aber er ist der Ausgangspunkt — und er erklärt, warum «lad einfach alles hoch» an einer harten Wand endet.

Wer zu viel hochlädt, bekommt nicht ein langsames Ergebnis — sondern ein abgeschnittenes

Hier liegt der Punkt, an dem die übliche Begründung kippt. Meistens hört man: Ein RAG sei schneller oder sparsamer. Beides ist schwach und angreifbar — denn es klingt nach einer Optimierung, auf die man auch verzichten könnte.

Die ehrliche Fassung ist härter. Beim Hochladen — in der Ollama-App wie über die API — landet der ganze Text bei jeder Frage im Kontextfenster. Ab einem gewissen Bestand passt er dort schlicht nicht mehr hinein. Was dann passiert, merkst du nicht als Wartezeit:

  • Du bekommst eine Antwort, und sie klingt plausibel.
  • Sie stützt sich aber nur auf den Teil, der noch ins Fenster gepasst hat.
  • Was abgeschnitten wurde, sagt dir niemand — Ollama vermerkt es nur im Server-Log, nicht im Chat.

Ab einem gewissen Bestand ist ein RAG darum nicht die schnellere Variante. Es ist die einzige, die überhaupt noch funktioniert.

Die drei Teile — und warum Ollama allein kein RAG ist

Wenn das Modell nicht alles sehen darf, muss jemand auswählen, was es sieht. Genau das ist die Aufgabe eines RAG-Chatbots: die paar Stellen finden, die zur gestellten Frage passen. Dafür braucht es drei Teile.

  1. Ein Embedding-Modell. Es macht aus Text Bedeutung.
  2. Eine Ablage — technisch eine Vektordatenbank. Dort liegt diese Bedeutung und ist durchsuchbar.
  3. Die Frage-Schicht. Sie stellt deine Frage, holt die passenden Stellen und legt sie dem Sprachmodell vor.

Das ist der Grund, warum eine verbreitete Erwartung enttäuscht wird: Ollama allein macht noch kein RAG. Ollama lässt das Sprachmodell laufen — das ist Teil drei, und auch davon nur ein Stück. Die Bedeutung und die Ablage kommen nicht von selbst dazu.

Ein RAG-Chatbot liest nicht mehr — er liest weniger. Genau darum kann er alles kennen.

Der Satz klingt zuerst verkehrt herum. Er ist aber die ganze Mechanik in einer Zeile: Weil pro Frage weniger Text beim Modell landet als bei einem Upload, darf der Bestand dahinter beliebig gross sein.

Bedeutung statt Buchstaben — warum das kein schnelleres Ctrl+F ist

Eine normale Suche vergleicht Buchstaben. Du tippst ein Wort, sie sucht dasselbe Wort. Steht im Dokument ein anderes, findet sie nichts — auch dann nicht, wenn es genau dasselbe meint. Jeder kennt das Ergebnis: Man rät so lange Suchbegriffe, bis einer trifft.

Ein Embedding-Modell vergleicht keine Buchstaben. Es vergleicht Bedeutung. In der Praxis sieht das so aus:

Ich stelle eine Frage in meinen eigenen Worten — und bekomme einen Artikel, in dem keines dieser Worte vorkommt. Er passt trotzdem. Weil er dasselbe meint.

Der eigentliche Sprung ist also nicht die Geschwindigkeit. Er liegt darin, dass du nicht mehr raten musst, welches Wort damals im Text stand. Und du siehst, aus welchem Artikel die Antwort kommt.

Was ein RAG kostet — und was er nicht kann

Ohne diesen Abschnitt klingt das Ganze nach Zauberei, und das wäre unredlich. Ein RAG hat zwei Kosten, und beide sollte man kennen, bevor man anfängt.

Erstens: Das Indexieren kostet Rechenzeit. Jedes Dokument muss einmal durch das Embedding-Modell, bevor es auffindbar ist. Der entscheidende Teil ist das Wort einmal — einmal pro Dokument, nicht pro Frage. Beim Hochladen zahlst du bei jeder Frage neu. Genau diese Verschiebung trägt den ganzen Aufbau.

Zweitens: Er kennt nur, was drin liegt. Was du nicht abgelegt hast, existiert für ihn nicht. Ein RAG-Chatbot ist kein Allwissender, sondern ein sehr guter Leser eines begrenzten Bestands. Wer ihn für allwissend hält, wird ihm irgendwann eine Frage stellen, deren Antwort nie in der Ablage war.

Und damit gilt die Regel aus der letzten Lektion unverändert weiter: Was nirgends hingehört, gibst du nirgends ein. Auch nicht lokal. Eine eigene Ablage hebt diese Entscheidung nicht auf — sie macht sie wichtiger, weil jetzt mehr an einem Ort liegt.

In 5 Schritten — direkt anwendbar

Prüfe zuerst, ob du überhaupt ein RAG brauchst
Passt dein Bestand in sechs bis acht A4-Seiten, brauchst du keines. Dann reicht es, den Text bei der Frage mitzugeben. Ein RAG lohnt sich erst, wenn der Bestand das Kontextfenster zuverlässig sprengt.
Schätze deinen Bestand grob ab
Nicht zählen — einordnen. Ein Handbuch, ein Ordner, ein ganzes Wiki: Das sind drei verschiedene Grössenordnungen und führen zu drei verschiedenen Entscheidungen. Für diesen Schritt genügt die Kategorie.
Trenne Quelle und Ablage im Kopf
Die Quelle ist der Ort, an dem du schreibst und pflegst. Die Ablage ist der Ort, an dem die Bedeutung liegt. Wer beides vermischt, pflegt am Ende zwei Bestände und wundert sich über widersprüchliche Antworten.
Kläre vorher, wer lesen darf
Alles in einer Ablage heisst: Wer fragen darf, sieht alles darin. Entscheide vor dem Befüllen, ob das für jeden Inhalt gilt — und was deshalb gar nicht erst hineinkommt.
Formuliere eine Testfrage in deinen eigenen Worten
Schreib eine Frage auf, wie du sie einem Kollegen stellen würdest — bewusst ohne die Fachwörter aus dem Dokument. An dieser Frage erkennst du später, ob die Ablage wirklich Bedeutung vergleicht oder doch nur Buchstaben.

Typische Fehler — und wie du sie vermeidest

Fünf Annahmen, die ein RAG-Projekt scheitern lassen, bevor es angefangen hat:

Glauben, das Modell lerne die hochgeladenen Dokumente
Es lernt im Betrieb nichts dazu. Es bekommt Text vorgelegt, bei jeder Frage neu. Wer das Bild vom Lernen behält, erwartet ein Gedächtnis, das es nicht gibt — und erklärt sich jede Lücke falsch.
Das Kontextfenster für eine Komfortgrenze halten
Es ist keine Empfehlung, sondern eine harte Wand. Was nicht hineinpasst, wird abgeschnitten — und die Antwort kommt trotzdem, sie klingt nur plausibler, als sie belegt ist.
Ein RAG mit «schneller» begründen
Das ist die schwache Fassung und lädt zum Widerspruch ein. Ab einem gewissen Bestand geht es nicht um Tempo, sondern darum, dass die Alternative schlicht unvollständige Antworten liefert.
Annehmen, Ollama bringe ein RAG schon mit
Ollama lässt das Sprachmodell laufen. Das Embedding-Modell und die Ablage sind eigene Teile. Wer das übersieht, sucht die Ursache später an der falschen Stelle.
Die Einmalkosten unterschlagen
Indexieren kostet Rechenzeit. Wer das verschweigt, verkauft Zauberei — und erklärt nicht, warum ein neues Dokument nicht sofort auffindbar ist.

Fazit

Ein RAG-Chatbot ist keine klügere KI. Er ist eine bessere Vorauswahl. Das Sprachmodell bleibt dasselbe, es bekommt nur nicht mehr den ganzen Stapel vorgelegt, sondern die paar Stellen, die zur Frage passen — und genau deshalb darf der Bestand dahinter beliebig gross sein.

Wer das einmal verstanden hat, stellt andere Fragen. Nicht mehr «welches Modell ist das beste», sondern «was liegt eigentlich in meiner Ablage, und wer darf es lesen». Das ist die Frage, die über den Nutzen entscheidet — nicht die Technik dahinter.

Ein konkreter erster Schritt, ganz ohne Werkzeug: Schreib eine Frage auf, die du deinem eigenen Wissensbestand stellen würdest, und daneben das Dokument, in dem die Antwort steht. Wenn du das Dokument nicht sicher benennen kannst, ist das bereits das Ergebnis — und der Grund, warum sich der Aufbau lohnt.

Dafür brauchst du keinen Termin: Nimm den ersten Praxisschritt und setz ihn heute an einem echten Fall um. Hängst du fest, findest du im Lernbereich das passende nächste Modul. Hilfe zur Selbsthilfe.

Weiterlernen statt warten

Die letzten 10 Prozent schaffst du selbst: Setz einen Schritt aus diesem Modul heute um und hol dir das nächste Thema im Lernbereich. Kostenlos, ohne Anmeldung.

Zum Lernbereich

Häufige Fragen

Was heisst RAG überhaupt?

Die Abkürzung steht für Retrieval Augmented Generation — ein Verfahren, bei dem passende Textstellen zuerst herausgesucht und dem Sprachmodell dann vorgelegt werden. Für die Praxis musst du den Begriff nicht auflösen. Es genügt, das Prinzip zu kennen: erst suchen, dann vorlegen — statt alles auf einmal hochzuladen.

Kann ich nicht einfach alle Dokumente in den Chat kopieren?

Bis zu einer gewissen Menge ja. Bei Ollama liegt das Kontextfenster standardmässig bei 4096 Token, also grob sechs bis acht A4-Seiten. Darüber hinaus wird abgeschnitten — und zwar ohne dass du es an der Antwort erkennst. Genau ab diesem Punkt wird ein RAG interessant.

Reicht Ollama allein für einen Chatbot auf eigenen Dokumenten?

Nein. Ollama lässt das Sprachmodell laufen, das ist ein Teil der Kette. Dazu kommen ein Embedding-Modell, das aus Text Bedeutung macht, und eine Ablage, in der diese Bedeutung liegt und durchsucht werden kann.

Worin unterscheidet sich das von einer normalen Volltextsuche?

Eine Volltextsuche vergleicht Buchstaben und findet nur, was wortgleich dasteht. Ein Embedding-Modell vergleicht Bedeutung. Deshalb findest du einen passenden Artikel auch dann, wenn keines deiner Suchworte darin vorkommt.

Wie oft muss ich neue Dokumente indexieren?

Einmal pro Dokument, nicht pro Frage. Neue oder geänderte Dokumente müssen erneut durch das Embedding-Modell, alles Übrige bleibt liegen. Diese Verschiebung von laufenden zu einmaligen Kosten ist der eigentliche Vorteil gegenüber dem Hochladen.

Was kann so ein Chatbot definitiv nicht?

Er kennt nur, was in seiner Ablage liegt. Was du nicht abgelegt hast, existiert für ihn nicht — er ist ein sehr guter Leser eines begrenzten Bestands, kein Allwissender. Wie du mit unsicheren Antworten umgehst, hat ein eigenes Thema weiter hinten in diesem Modul.

Quellen & Zahlen

Eine Zahl in diesem Beitrag stützt sich auf die Dokumentation von Ollama: das Standard-Kontextfenster von 4096 Token. Hier steht die Originalquelle dazu.

Abgerufen am 15. September 2026. Ollama ändert Standardwerte mit neuen Versionen — der Wert kann sich verschieben, die Mechanik dahinter nicht.

Lieber als PDF mitnehmen?

Den vollständigen Inhalt dieser Seite gibt es zusätzlich als strukturiertes PDF-Paket — zum Offline-Lesen, Markieren und Weitergeben. Eine reine Komfort-Leistung. Der gesamte Inhalt bleibt weiter kostenlos auf dieser Seite — kein Login, keine Paywall, kein versteckter Bezahl-Inhalt.

Was im Paket enthalten ist

  • PDF-Raster: die drei Teile eines RAG-Chatbots — Embedding-Modell, Ablage, Frage-Schicht — mit dem Vergleich Upload vs. RAG auf einer Seite.
  • Checkliste vor dem Aufbau: Bestand einordnen, Quelle und Ablage trennen, Leserechte klären, Testfrage formulieren.
  • Direkt-Link zur ungelisteten Langversion des Videos

9 EUR · einmalig · ohne Abo

Auf CopeCart öffnen →

Abwicklung über CopeCart GmbH (DE) als Merchant of Record. Details in AGB §12.