Synology, KI und Selbsthosting 12 Min. Lesezeit

Synology AI mit einem lokalen LLM über Ollama oder LM Studio verbinden

Ein Sprachmodell zu Hause betreiben, es als OpenAI-kompatible API bereitstellen und an Synology AI Console anbinden, um MailPlus und Office ohne Onlinedienst zu versorgen.

Diese Anleitung erklärt, wie Sie Synology AI mit einem Sprachmodell verbinden, das bei Ihnen läuft — mit Ollama oder LM Studio —, um die KI-Funktionen von DSM ohne Onlinedienst zu nutzen.

Einleitung

Dieser Text will zeigen, wie man eine lokale KI an Synology AI anbindet, mehr nicht. Ich ergänze einige persönliche Schlussfolgerungen sowie Empfehlungen zu Hard- und Software, doch das sind Randbemerkungen, die das Bild vollständig machen sollen.

Synology entwickelt kein eigenes KI-Modell. Das Unternehmen liefert jedoch eine Schnittstelle, die Synology AI Console, mit der sich Modelle Dritter anbinden lassen. Andere Hersteller verfolgen einen vergleichbaren Ansatz, doch Synology hat ihn recht früh umgesetzt.

Die meisten in der Cloud betriebenen Modelle setzen ein Abonnement oder eine nutzungsabhängige Abrechnung ihrer API voraus und bedeuten, dass Ihre Inhalte in die Infrastruktur eines Dritten wandern. Für einen Firmenserver oder ein Familien-NAS genügen diese beiden Punkte oft, um die Lösung auszuschließen.

Zufall oder nicht: Ein Update der Synology AI Console hat es möglich gemacht, jedes zur OpenAI-API kompatible Modell anzubinden, auch ein lokales. Genau das zeige ich hier. Der zusätzliche Gewinn ist der Datenschutz: Die Daten gehen nicht zu einem externen Dienst, sie bleiben in Ihrem eigenen Ökosystem.

Das Dialogfenster „API-Integration hinzufügen“ der Synology AI Console mit der Liste der Anbieter
In der Anbieterliste steht ein Eintrag „OpenAI-kompatible API“: Er öffnet die Tür zu selbst gehosteten Modellen.
Verwandte Beiträge

Wie sich die KI-Funktionen in den Anwendungen verhalten, wird gesondert behandelt, in den Anleitungen zu Synology MailPlus und zu Synology Office.

Systemanforderungen

Eine lokale KI zu betreiben verlangt passende Software und Hardware. Auf der Softwareseite eignen sich zwei Werkzeuge: Ollama und LM Studio. Ollama läuft unter Windows, Linux und macOS, grafisch wie im Servermodus; mit einer Karte von NVIDIA oder AMD ist es vermutlich die bessere Wahl. LM Studio gibt es nur als grafische Anwendung und passt besonders gut zu macOS auf Prozessoren ab dem Apple M1.

  • Ollama ist eine Server-Engine zum Ausführen von Sprachmodellen. Sie läuft im Hintergrund wie ein Dienst und stellt eine einfache API bereit. Ihre Hauptaufgabe ist es, Modelle effizient und über lange Zeit zu laden und auszuführen. Das ist die sinnvolle Wahl, wenn Sie ein Modell in eine Anwendung einbauen oder als Netzwerkdienst bereitstellen wollen.
  • LM Studio ist eine grafische Desktop-Anwendung für Windows und macOS, mit der Sie Modelle suchen, herunterladen und in einer Oberfläche testen, die einem Chat-Assistenten ähnelt. Ihre Besonderheit ist die Funktion „Local Server“: Mit einem Klick wird jedes geladene Modell zu einem OpenAI-kompatiblen API-Server. Das ist das ideale Werkzeug, um schnell zu starten, zu experimentieren und seine Modelle ohne Kommandozeile visuell zu verwalten.

💻 Mindestkonfiguration (damit es läuft)

KomponenteAnforderungenFolge
Prozessor (CPU) 4 Kerne oder mehr (Intel i5 / AMD Ryzen 5 / Apple M1 und neuer). Eine moderne Architektur zählt mehr als die Taktfrequenz. Läuft ohne GPU, aber langsam (1 bis 5 Token pro Sekunde).
Arbeitsspeicher (RAM) 16 GBMinimum. 24 GB und mehrempfohlen für stabilen Betrieb. Ein 8B-Modell + System + Anwendungen ≈ 12 bis 14 GB. Mit 16 GB wird es knapp.
Speicher (SSD) Eine NVMe-SSD mit mindestens 256 GB. Ein Modell mit 7B-8B belegt 5 bis 10 GB. Schnelles Laden des Modells in den Speicher. Eine mechanische Festplatte ist hier unbrauchbar.
System Linux (Ubuntu), Windows 10/11, macOS Sonoma und neuer. Linux bringt 10 bis 15 % zusätzliche Leistung.

🎮 Empfohlene Konfiguration (für komfortables Arbeiten)

KomponenteAnforderungenWas es bringt
Grafikkarte (GPU) Unverzichtbar für die Geschwindigkeit.
NVIDIA: GTX 1660 6 GB (Minimum), RTX 3060 12 GB (optimal)
AMD: RX 6700 XT 12 GB und mehr
Apple: M1 Pro / M2 / M3 mit 16 GB und mehr
Zehn- bis fünfzigfache Beschleunigung. Das Modell arbeitet im VRAM und gibt den Arbeitsspeicher frei.
GPU-Speicher (VRAM) Mindestens 8 GB für Modelle mit 7B. 12 GB und mehr empfohlen für 8B-14B mit etwas Reserve. Je mehr VRAM, desto größer das Kontextfenster und desto schneller die Verarbeitung.
Arbeitsspeicher 32 GB DDR4/DDR5 Reserve für System, Browser und die Arbeit an Dokumenten.
Prozessor 8 Kerne oder mehr (Intel i7 / AMD Ryzen 7) Bessere Verarbeitung der Anfragen, wenn ein Teil des Modells im Arbeitsspeicher bleibt.

Nach meiner Erfahrung eignet sich eine im Prozessor integrierte GPU — oder der Prozessor allein — schlecht für KI-Aufgaben. Natürlich lässt sich so ein Modell betreiben, doch die AMD-Unterstützung in ROCm bleibt schwach. Karten von NVIDIA liefern die besten Ergebnisse; die ausführliche Liste steht in der Dokumentation des Herstellers.

Allgemein halte ich den Mac mini mit einem ARM-Prozessor M1 Pro oder neuer für die ideale Lösung dieses Einsatzzwecks. Man sollte lediglich 32 bis 64 GB Arbeitsspeicher anpeilen, gern auch 128 GB: je mehr, desto besser. Das ist aus meiner Sicht das beste Verhältnis von Ergebnis und Preis für eine lokale KI — wer hätte gedacht, dass Apple die günstigere Wahl ist.

Das Modell wählen

Wählen Sie nach dem verfügbaren Arbeitsspeicher. Das ausgewogenste Modell ist aus meiner Sicht gpt-oss:20b, veröffentlicht von OpenAI.

  • Mit 16 GB RAM: Modelle mit 7B bis 8B Parametern passen am besten, etwa Qwen2.5-7B-Instruct oder DeepSeek-R1:8b.
  • Mit 32 GB RAM: Sie können kräftigere Modelle betreiben, von 14B bis 20B Parametern, etwa DeepSeek-R1:14b für Analysen oder gpt-oss:20b für die beste Werkzeugkompatibilität.
  • Mit 64 GB RAM: Das gesamte Feld bis 30B-32B Parameter wird zugänglich, darunter Qwen3:30b und DeepSeek-R1:32b, was die beste Antwortqualität und das größte Kontextfenster ergibt.
Faustregel

Verwenden Sie stets die Instruct-Fassungen der Modelle und das Format GGUF, das die Kompatibilität sichert.

Die Suchleiste von Open WebUI bietet an, gpt-oss:20b von Ollama.com herunterzuladen
In Open WebUI genügt die Eingabe des Modellnamens: Die Oberfläche bietet den Download von Ollama.com an.

Ollama installieren

Nehmen wir an, Sie haben einen PC mit Linux Ubuntu und möchten es dort ausprobieren. Ich selbst habe den Test auf einem Aoostar WTR Pro mit dem Hypervisor Proxmox durchgeführt: Dort habe ich eine virtuelle Maschine mit 8 Kernen und 16 GB Arbeitsspeicher angelegt.

Der Rest ist einfach: Ollama mit einer Weboberfläche installieren, die sich bequemer verwalten lässt.

Befehle:

sudo apt update
sudo apt upgrade
sudo apt install docker.io docker-compose -y
sudo systemctl enable --now docker
sudo usermod -aG docker $USER
sudo reboot

Bereiten wir nun den Ordner für Ollama vor:

cd /opt/
sudo mkdir ollama
sudo chown $USER ollama
cd ollama/

Legen Sie mit nano docker-compose.yml eine Datei mit folgendem Inhalt an:

version: '3.8'
services:
  ollama-webui:
    image: ghcr.io/open-webui/open-webui:ollama
    container_name: ollama-webui
    restart: unless-stopped
    ports:
      - "11434:11434"  # Port der Ollama-API
      - "8080:8080"    # Port der Weboberfläche Open WebUI
    environment:
      # Zentrale Einstellung: erlaubt Verbindungen zur Ollama-API von anderen Adressen
      - OLLAMA_HOST=0.0.0.0
      - OLLAMA_ORIGINS=*
    volumes:
      - ./ollama_data:/root/.ollama          # Ablage der heruntergeladenen Modelle
      - ./openwebui_data:/app/backend/data   # Daten von Open WebUI (Verläufe, Einstellungen)
volumes:
  ollama_data:
  openwebui_data:

Starten Sie danach den Container:

docker-compose up -d

Sobald der Container läuft, öffnen Sie die Weboberfläche von Ollama unter http://IP:8080. Nachdem Sie einen Benutzer angelegt und sich angemeldet haben, laden Sie das Modell gpt-oss:20b oder ein anderes Modell Ihrer Wahl herunter.

LM Studio einrichten

Auf einem Mac ist LM Studio die bessere Wahl, verlangt aber etwas Einrichtung. Zuerst ist der Entwicklermodus zu aktivieren, danach der Zugriff auf den Server aus dem lokalen Netz zu erlauben, wie auf den folgenden Bildschirmfotos.

Die Einstellungen von LM Studio mit der Oberflächenstufe „Entwickler“
Erste Einstellung in LM Studio: die Oberflächenstufe auf „Entwickler“ setzen, damit die Registerkarte für den Server erscheint.
Der lokale Server von LM Studio läuft mit aktivierter Bereitstellung im lokalen Netz
Zweite Einstellung: den Server starten und danach „Im lokalen Netzwerk bereitstellen“ aktivieren, damit das NAS ihn erreicht.

Synology AI Console einrichten

Um die lokale KI an das NAS anzubinden, öffnen Sie die Synology AI Console und fügen eine neue Integration hinzu. Geben Sie ihr einen Namen, wählen Sie die Schnittstelle „OpenAI-kompatible API“ und tragen Sie eine URL der Form http://IP:11434/v1 ein. Klicken Sie danach auf „Liste der generativen Modelle abrufen“: Das System liefert alle geladenen Modelle zurück. Wählen Sie das gewünschte aus. Für Kontextfenster und Ausgabe-Token setzen Sie mindestens 8192 und 4096 an. Je höher, desto besser, doch alles hängt von Ihrer Hardware ab.

Eine API-Integration der Synology AI Console, die auf einen lokalen Ollama-Server zeigt
Die vollständige Integration: Basis-URL des lokalen Servers, Abruf der Modellliste, Kontextfenster und Ausgabe-Token.

Das Ergebnis prüfen

Stimmt alles, lassen sich die KI-Funktionen in Synology Office und Synology MailPlus nutzen. Sie laufen lokal, bleiben vollständig vertraulich, und ihr Tempo hängt nur noch von Ihrer Hardware ab.

Der KI-Assistent von Synology Office verfasst Text in einem Dokument
In Synology Office schreibt der Assistent nach einer Vorgabe — die Verarbeitung bleibt auf der lokalen Maschine.
Eine ausführliche Zusammenfassung eines E-Mail-Verlaufs in Synology MailPlus
In MailPlus greift die ausführliche Zusammenfassung die Anfrage, die genannten Voraussetzungen und die ausgetauschten Kontaktdaten auf.

Damit ist es geschafft. Sie wissen nun, wie Sie Synology AI an ein lokales Sprachmodell anbinden, das von Ollama oder LM Studio ausgeführt wird.

Quellen

Über den Autor

Jeremy Kraft betreut die Infrastruktur und die selbst gehosteten Dienste des IBCSC. Diese Anleitungen beschreiben Konfigurationen, die tatsächlich im Einsatz waren und vor der Veröffentlichung erneut geprüft wurden.

Diskussion

Kommentare

0

Noch kein Kommentar. Eröffnen Sie die Diskussion gern mit einer Frage oder Ihrem eigenen Erfahrungsbericht.