Synology AI mit einem lokalen LLM über Ollama oder LM Studio verbinden
Ein Sprachmodell zu Hause betreiben, es als OpenAI-kompatible API bereitstellen und an Synology AI Console anbinden, um MailPlus und Office ohne Onlinedienst zu versorgen.
Diese Anleitung erklärt, wie Sie Synology AI mit einem Sprachmodell verbinden, das bei Ihnen läuft — mit Ollama oder LM Studio —, um die KI-Funktionen von DSM ohne Onlinedienst zu nutzen.
Einleitung
Dieser Text will zeigen, wie man eine lokale KI an Synology AI anbindet, mehr nicht. Ich ergänze einige persönliche Schlussfolgerungen sowie Empfehlungen zu Hard- und Software, doch das sind Randbemerkungen, die das Bild vollständig machen sollen.
Synology entwickelt kein eigenes KI-Modell. Das Unternehmen liefert jedoch eine Schnittstelle, die Synology AI Console, mit der sich Modelle Dritter anbinden lassen. Andere Hersteller verfolgen einen vergleichbaren Ansatz, doch Synology hat ihn recht früh umgesetzt.
Die meisten in der Cloud betriebenen Modelle setzen ein Abonnement oder eine nutzungsabhängige Abrechnung ihrer API voraus und bedeuten, dass Ihre Inhalte in die Infrastruktur eines Dritten wandern. Für einen Firmenserver oder ein Familien-NAS genügen diese beiden Punkte oft, um die Lösung auszuschließen.
Zufall oder nicht: Ein Update der Synology AI Console hat es möglich gemacht, jedes zur OpenAI-API kompatible Modell anzubinden, auch ein lokales. Genau das zeige ich hier. Der zusätzliche Gewinn ist der Datenschutz: Die Daten gehen nicht zu einem externen Dienst, sie bleiben in Ihrem eigenen Ökosystem.
Wie sich die KI-Funktionen in den Anwendungen verhalten, wird gesondert behandelt, in den Anleitungen zu Synology MailPlus und zu Synology Office.
Systemanforderungen
Eine lokale KI zu betreiben verlangt passende Software und Hardware. Auf der Softwareseite eignen sich zwei Werkzeuge: Ollama und LM Studio. Ollama läuft unter Windows, Linux und macOS, grafisch wie im Servermodus; mit einer Karte von NVIDIA oder AMD ist es vermutlich die bessere Wahl. LM Studio gibt es nur als grafische Anwendung und passt besonders gut zu macOS auf Prozessoren ab dem Apple M1.
- Ollama ist eine Server-Engine zum Ausführen von Sprachmodellen. Sie läuft im Hintergrund wie ein Dienst und stellt eine einfache API bereit. Ihre Hauptaufgabe ist es, Modelle effizient und über lange Zeit zu laden und auszuführen. Das ist die sinnvolle Wahl, wenn Sie ein Modell in eine Anwendung einbauen oder als Netzwerkdienst bereitstellen wollen.
- LM Studio ist eine grafische Desktop-Anwendung für Windows und macOS, mit der Sie Modelle suchen, herunterladen und in einer Oberfläche testen, die einem Chat-Assistenten ähnelt. Ihre Besonderheit ist die Funktion „Local Server“: Mit einem Klick wird jedes geladene Modell zu einem OpenAI-kompatiblen API-Server. Das ist das ideale Werkzeug, um schnell zu starten, zu experimentieren und seine Modelle ohne Kommandozeile visuell zu verwalten.
💻 Mindestkonfiguration (damit es läuft)
| Komponente | Anforderungen | Folge |
|---|---|---|
| Prozessor (CPU) | 4 Kerne oder mehr (Intel i5 / AMD Ryzen 5 / Apple M1 und neuer). Eine moderne Architektur zählt mehr als die Taktfrequenz. | Läuft ohne GPU, aber langsam (1 bis 5 Token pro Sekunde). |
| Arbeitsspeicher (RAM) | 16 GB — Minimum. 24 GB und mehr — empfohlen für stabilen Betrieb. | Ein 8B-Modell + System + Anwendungen ≈ 12 bis 14 GB. Mit 16 GB wird es knapp. |
| Speicher (SSD) | Eine NVMe-SSD mit mindestens 256 GB. Ein Modell mit 7B-8B belegt 5 bis 10 GB. | Schnelles Laden des Modells in den Speicher. Eine mechanische Festplatte ist hier unbrauchbar. |
| System | Linux (Ubuntu), Windows 10/11, macOS Sonoma und neuer. | Linux bringt 10 bis 15 % zusätzliche Leistung. |
🎮 Empfohlene Konfiguration (für komfortables Arbeiten)
| Komponente | Anforderungen | Was es bringt |
|---|---|---|
| Grafikkarte (GPU) | Unverzichtbar für die Geschwindigkeit. • NVIDIA: GTX 1660 6 GB (Minimum), RTX 3060 12 GB (optimal) • AMD: RX 6700 XT 12 GB und mehr • Apple: M1 Pro / M2 / M3 mit 16 GB und mehr |
Zehn- bis fünfzigfache Beschleunigung. Das Modell arbeitet im VRAM und gibt den Arbeitsspeicher frei. |
| GPU-Speicher (VRAM) | Mindestens 8 GB für Modelle mit 7B. 12 GB und mehr empfohlen für 8B-14B mit etwas Reserve. | Je mehr VRAM, desto größer das Kontextfenster und desto schneller die Verarbeitung. |
| Arbeitsspeicher | 32 GB DDR4/DDR5 | Reserve für System, Browser und die Arbeit an Dokumenten. |
| Prozessor | 8 Kerne oder mehr (Intel i7 / AMD Ryzen 7) | Bessere Verarbeitung der Anfragen, wenn ein Teil des Modells im Arbeitsspeicher bleibt. |
Nach meiner Erfahrung eignet sich eine im Prozessor integrierte GPU — oder der Prozessor allein — schlecht für KI-Aufgaben. Natürlich lässt sich so ein Modell betreiben, doch die AMD-Unterstützung in ROCm bleibt schwach. Karten von NVIDIA liefern die besten Ergebnisse; die ausführliche Liste steht in der Dokumentation des Herstellers.
Allgemein halte ich den Mac mini mit einem ARM-Prozessor M1 Pro oder neuer für die ideale Lösung dieses Einsatzzwecks. Man sollte lediglich 32 bis 64 GB Arbeitsspeicher anpeilen, gern auch 128 GB: je mehr, desto besser. Das ist aus meiner Sicht das beste Verhältnis von Ergebnis und Preis für eine lokale KI — wer hätte gedacht, dass Apple die günstigere Wahl ist.
Das Modell wählen
Wählen Sie nach dem verfügbaren Arbeitsspeicher. Das ausgewogenste Modell ist aus meiner Sicht gpt-oss:20b, veröffentlicht von OpenAI.
- Mit 16 GB RAM: Modelle mit 7B bis 8B Parametern passen am besten, etwa Qwen2.5-7B-Instruct oder DeepSeek-R1:8b.
- Mit 32 GB RAM: Sie können kräftigere Modelle betreiben, von 14B bis 20B Parametern, etwa DeepSeek-R1:14b für Analysen oder gpt-oss:20b für die beste Werkzeugkompatibilität.
- Mit 64 GB RAM: Das gesamte Feld bis 30B-32B Parameter wird zugänglich, darunter Qwen3:30b und DeepSeek-R1:32b, was die beste Antwortqualität und das größte Kontextfenster ergibt.
Verwenden Sie stets die Instruct-Fassungen der Modelle und das Format GGUF, das die Kompatibilität sichert.
Ollama installieren
Nehmen wir an, Sie haben einen PC mit Linux Ubuntu und möchten es dort ausprobieren. Ich selbst habe den Test auf einem Aoostar WTR Pro mit dem Hypervisor Proxmox durchgeführt: Dort habe ich eine virtuelle Maschine mit 8 Kernen und 16 GB Arbeitsspeicher angelegt.
Der Rest ist einfach: Ollama mit einer Weboberfläche installieren, die sich bequemer verwalten lässt.
Befehle:
sudo apt update
sudo apt upgrade
sudo apt install docker.io docker-compose -y
sudo systemctl enable --now docker
sudo usermod -aG docker $USER
sudo reboot
Bereiten wir nun den Ordner für Ollama vor:
cd /opt/
sudo mkdir ollama
sudo chown $USER ollama
cd ollama/
Legen Sie mit nano docker-compose.yml eine Datei mit folgendem Inhalt an:
version: '3.8'
services:
ollama-webui:
image: ghcr.io/open-webui/open-webui:ollama
container_name: ollama-webui
restart: unless-stopped
ports:
- "11434:11434" # Port der Ollama-API
- "8080:8080" # Port der Weboberfläche Open WebUI
environment:
# Zentrale Einstellung: erlaubt Verbindungen zur Ollama-API von anderen Adressen
- OLLAMA_HOST=0.0.0.0
- OLLAMA_ORIGINS=*
volumes:
- ./ollama_data:/root/.ollama # Ablage der heruntergeladenen Modelle
- ./openwebui_data:/app/backend/data # Daten von Open WebUI (Verläufe, Einstellungen)
volumes:
ollama_data:
openwebui_data:
Starten Sie danach den Container:
docker-compose up -d
Sobald der Container läuft, öffnen Sie die Weboberfläche von Ollama unter http://IP:8080. Nachdem Sie einen Benutzer angelegt und sich angemeldet haben, laden Sie das Modell gpt-oss:20b oder ein anderes Modell Ihrer Wahl herunter.
LM Studio einrichten
Auf einem Mac ist LM Studio die bessere Wahl, verlangt aber etwas Einrichtung. Zuerst ist der Entwicklermodus zu aktivieren, danach der Zugriff auf den Server aus dem lokalen Netz zu erlauben, wie auf den folgenden Bildschirmfotos.
Synology AI Console einrichten
Um die lokale KI an das NAS anzubinden, öffnen Sie die Synology AI Console und fügen eine neue Integration hinzu. Geben Sie ihr einen Namen, wählen Sie die Schnittstelle „OpenAI-kompatible API“ und tragen Sie eine URL der Form http://IP:11434/v1 ein. Klicken Sie danach auf „Liste der generativen Modelle abrufen“: Das System liefert alle geladenen Modelle zurück. Wählen Sie das gewünschte aus. Für Kontextfenster und Ausgabe-Token setzen Sie mindestens 8192 und 4096 an. Je höher, desto besser, doch alles hängt von Ihrer Hardware ab.
Das Ergebnis prüfen
Stimmt alles, lassen sich die KI-Funktionen in Synology Office und Synology MailPlus nutzen. Sie laufen lokal, bleiben vollständig vertraulich, und ihr Tempo hängt nur noch von Ihrer Hardware ab.
Damit ist es geschafft. Sie wissen nun, wie Sie Synology AI an ein lokales Sprachmodell anbinden, das von Ollama oder LM Studio ausgeführt wird.
Diskussion
Kommentare
Noch kein Kommentar. Eröffnen Sie die Diskussion gern mit einer Frage oder Ihrem eigenen Erfahrungsbericht.
Die Anmeldung hält den Austausch frei von Spam und verhindert, dass Ihre E-Mail-Adresse veröffentlicht wird.
Zum Kommentieren anmelden →