Open Notebook - Teil 3

21. Juni 2026 - Lesezeit: 16 Minuten

Docker Desktop wird über das Startmenü oder Shell gestartet

systemctl --user start docker-desktop

Die Container sind aufgelistet und im Status erfolgreich gestartet.



Neben den Containern sind die zugehörigen Portnummer zu sehen (bzw. aufklappbar) und und klickbar.

Ollama

Ollama ist ein lokales KI-Tool, das verschiedene KI-Modelle betreiben kann. In dieser installation wurde Ollama innerhalb eines Docker-Containers gestartet.

KI-Modelle auswählen

Zunächst einmal müssen KI-Modelle für Ollama heruntergeladen und installiert werden. Später können verschiedene KI-Modelle für verschiedene Aufgaben in Open Notebook zugewiesen werden, z.B. Embedding und Chatbot.

Es gibt Modelle unterschiedlicher Hersteller und häufig verschiedene Varianten des selben Modells mit unterschiedlicher Genauigkeit/Qualität (Anzahl Parameter). Dabei erhöht die Wahl eines Modells mit besserer Genauigkeit/Qualität den Bedarf an (V)RAM und die Rechenleistung. Die verwendeten Modelle sollten also passend zur eigenen Rechnerausstattung sein. Die verfügbaren Modelle und Varianten für Ollama können in der Library eingesehen werden. Es gibt unterschiedliche Modelle für unterschiedliche Aufgaben. Multimodale Modelle sind für mehr als eine Aufgabe geeignet, z.B. Text- und Bildanalyse. Auf huggingface können Modelle eingesehen und online getestet werden.

  • Allzweck- und Chat-Modelle
    Diese Modelle sind wahre Alleskönner. Sie eignen sich hervorragend für allgemeine Fragen, das Zusammenfassen von Texten oder das Befolgen komplexer Anweisungen.
    • Llama von Meta AI (z.B. Llama 3): Eines der leistungsstärksten Standardmodelle, das eine exzellente Balance zwischen Geschwindigkeit und Qualität bietet.
    • Gemma von Google AI (z.B. Gemma 4 / 3): Ein Modell, das besonders schnell ist und sich gut für alltägliche Unterhaltungen und Assistenzaufgaben eignet.
    • Qwen von Alibaba Cloud (z.B. Qwen 2.5 / 3): Ein weiteres leistungsstarkes Open-Source-Modell, das bei einer Vielzahl von Aufgaben sehr gut abschneidet.
    • Mistral von Mistral AI (z.B. Mistral-Nemo): Hervorragend bei Textübersetzungen, Zusammenfassungen und Logikaufgaben, sehr stark in Deutsch und vielen anderen Sprachen.
  • Programmierung (Coding)
    Diese Modelle sind speziell darauf trainiert, Quellcode zu verstehen, zu schreiben, zu debuggen und in verschiedenen Programmiersprachen zu optimieren.
    • Qwen-Coder von Alibaba Cloud (z.B. Qwen3 Coder): Führend in seiner Klasse und exzellent für das Entwickeln ("Vibe Coding") sowie für komplexe Programmieraufgaben. 
    • DeepSeek von DeepSeek AI (z.B. DeepSeek R1): Sehr stark bei mathematischen und logischen Denkaufgaben sowie der Codegenerierung.
    • Codestral von Mistral AI: Reine Spezialisierung auf Programmierung und Code-Generierung, beherrscht über 80 Programmiersprachen.
  • Kompakte Modelle
    Besonders ressourcenschonende Modelle, die sich hervorragend für ältere Computer, Handys oder den Einsatz als schnelle Hintergrund-KI (z.B. für Smarthome-Befehle) eignen.
    • Phi von Microsoft (z.B. Phi-4 Mini): Trotz seiner geringen Größe (benötigt nur ca. 4 GB VRAM) verfügt dieses Modell über starke logische Fähigkeiten.
    • Qwen-Mini von Alibaba Cloud: Eine kleinere, sehr schnelle Variante der Qwen-Familie.
  • Weitere Spezialmodelle
    Neben textbasierten Modellen bietet Ollama z.B. auch Unterstützung für sogenannte multimodale Aufgaben.
    • Vision-Modelle (Qwen-VL von Alibaba Cloud, Llama-Vision von Meta AI): Diese Modelle können neben Text auch Bilder analysieren, beschreiben oder Bildunterschriften generieren.
    • Embedding-Modelle (nomic-embed-text von Nomic AI, jina-embeddings-v2-base-de  von Jina AI, BGE-M3 von BAAI) erzeugen numerische Vektoren (Zahlenreihen) für Texte, keine Sprachausgaben. Für mehrsprachige oder rein deutsche Texte benötigt man ein geeignetes mehrsprachiges Modell.
    • Reasoning-Modelle: Deep Thinking ist eine Funktion die hilft knifflige Probleme zu lösen. Es funktioniert so, dass man mehrere Ideen gleichzeitig mit parallelem Denken durchdenkt, sie vergleicht und dann die beste Lösung auswählt.
    • TTS/STT-Modelle (text to speech / Speech to text) für Sprachausgaben müssen als lokale Instalation via OpenAI-kompatibler API angebunden werden. Ollama unterstützt das nicht. Man braucht dazu einen weiteren Container z.B. mit speaches-ai.
    • Mixture of Experts Modelle: MoE ist eine KI-Architektur, bei der ein großes neuronales Netz in viele kleine, spezialisierte Teilnetze (die "Experten") unterteilt wird. Ein Steuerungsmechanismus (der "Router") leitet jede Anfrage dynamisch nur an die Experten weiter, die für das jeweilige Problem am besten geeignet sind. 
    • Tools (Function Calling) ist die Fähigkeit eines Sprachmodells selbstständig Programme, APIs, Webseiten oder andere externe Skripte auszuführen, anstatt nur Text zu generieren
    • MLX ist Apples eigenes Machine-Learning-Framework. Modelle mit MLX im Namen sind für Apple Silicon CPUs.

Open Notebook verwendet Esperanto zur Anbindung der verschiedener KI-Provider. Es gibt eine Übersicht, welche Anbieter/Modelle welche Aufgaben (Embedding, Chat, TTS, STT) erledigen können. Da mit Ollama keine Audio Ein- oder Ausgabe angebunden werden kann wird Audio erstmal vertagt.

Ollama Modellname

Hersteller Herkunft Features Parameter Kontext Größe Kommentar
mistral Mistral AI Frankreich tools 7b 32K 4,4GB Open Notebook Doku: Fastest & smallest (recommended for testing)
neural-chat Intel USA 7b 32K 4,1GB Open Notebook Doku: Better quality but slower
llama2 Meta AI USA 7b 4K 3,8GB Open Notebook Doku: Even better quality, more VRAM needed
qwen3-embedding:4b Alibaba Cloud China embedding 4b 32K 2,5GB für RAG (Dokumente in Datenbank scannen)
qwen3-embedding:8b Alibaba Cloud China embedding 8b 32K 4,7GB für RAG (Dokumente in Datenbank scannen)
bge-m3 BAAI China embedding 0,6b 8K 1,2GB für RAG (Dokumente in Datenbank scannen)
jina-embeddings-v2-base-de Jina AI Deutschland embedding 0,2b 8K 0,3GB für RAG (Dokumente in Datenbank scannen)
gemma4 Google AI USA vision, tools, thinking, audio e4b 128K 9,6GB für Chat, Suche
gemma4:26b Google AI USA vision, tools, thinking, audio 26b 256K 18GB für Chat, Suche, MoE Modell mit 4B aktive Parameter
deepseek-r1 DeepSeek AI China tools, thinking 8b 128K 5,2GB für Chat, Suche
llama3.1 Meta AI USA tools 8b 128K 4,9GB für Chat, Suche
qwen3.5 Alibaba Cloud China vision, tools, thinking 9b 256K 6,6GB für Chat, Suche
glm4 Zhipu AI China 9b 128K 5,5GB für Chat, Suche

Man sollte mindestens ein auf Chat/Suche und ein auf Embedding optimiertes Modell herunterladen. Dabei ist zu beachten, wie viel freier (V)RAM auf der eigenen Hardware zur Verfügung steht.

KI-Modelle installieren
  • Empfehlung für kleine Hardwareausstattung ~4,7GB (V)RAM:
docker exec open-notebook-ollama-1 ollama pull jina/jina-embeddings-v2-base-de

docker exec open-notebook-ollama-1 ollama pull mistral
  • Empfehlung für mittlere Genauigkeit/Qualität ~7,8GB (V)RAM:
docker exec open-notebook-ollama-1 ollama pull bge-m3

docker exec open-notebook-ollama-1 ollama pull qwen3.5
  • Empfehlung für hohe Genauigkeit/Qualität ~12,1GB (V)RAM:
docker exec open-notebook-ollama-1 ollama pull qwen3-embedding:4b

docker exec open-notebook-ollama-1 ollama pull gemma4
  • Empfehlung für höchste Genauigkeit/Qualität ~22,7GB (V)RAM:
docker exec open-notebook-ollama-1 ollama pull qwen3-embedding:8b

docker exec open-notebook-ollama-1 ollama pull gemma4:26b
GPU-Nutzung überprüfen

Wenn in der Ollama-Docker-Konfiguration die Unterstützung für NVidia-GPUs aktiviert wurde kann die Funktionalität überprüft werden. Bei der Ollama-Prozessübersicht muß die Spalte PROCESSOR mit GPU gefüllt sein.

docker exec open-notebook-ollama-1 ollama ps
NAME             ID              SIZE      PROCESSOR    CONTEXT    UNTIL
llama2:latest    78e26419b446    6.0 GB    100% GPU     4096       3 minutes from now

Die Abfrage kann auch direkt in Docker Desktop erfolgen.

Weiter gehts mit der Konfiguration in Teil 4.