Synology, AI en zelfhosting 12 min. leestijd

Synology AI verbinden met een lokaal LLM via Ollama of LM Studio

Een taalmodel thuis draaien, het aanbieden als OpenAI-compatibele API en het koppelen aan Synology AI Console om MailPlus en Office te voeden zonder onlinedienst.

Deze gids legt uit hoe u Synology AI verbindt met een taalmodel dat bij u draait, met Ollama of LM Studio, zodat u de AI-functies van DSM kunt gebruiken zonder van een onlinedienst af te hangen.

Inleiding

Dit stuk wil tonen hoe u een lokale AI aan Synology AI koppelt, meer niet. Ik voeg er enkele persoonlijke conclusies en aanbevelingen voor hardware en software aan toe, maar dat zijn zijsprongen om het beeld volledig te maken.

Synology ontwikkelt geen eigen AI-model. Het bedrijf levert wel een interface, Synology AI Console, waarmee u er modellen van derden aan koppelt. Andere fabrikanten volgen een vergelijkbare aanpak, maar Synology heeft die vrij vroeg uitgewerkt.

De meeste modellen in de cloud vragen een abonnement of afrekening per gebruik van hun API, en betekenen dat uw inhoud naar de infrastructuur van een derde partij gaat. Voor een bedrijfsserver of een gezins-NAS volstaan die twee punten vaak om de oplossing af te wijzen.

Toeval of niet, een update van Synology AI Console maakte het mogelijk elk model te koppelen dat compatibel is met de API van OpenAI, ook een lokaal model. Precies dat toon ik hier. De extra winst is de vertrouwelijkheid: de gegevens gaan niet naar een externe dienst, ze blijven binnen uw eigen omgeving.

Het dialoogvenster “Een API-integratie toevoegen” van Synology AI Console met de lijst van aanbieders
In de lijst van aanbieders staat een item “OpenAI-compatibele API”: dat opent de deur naar zelfgehoste modellen.
Verwante artikelen

Hoe de AI-functies zich in de toepassingen gedragen, komt apart aan bod in de gidsen over Synology MailPlus en Synology Office.

Systeemvereisten

Een lokale AI uitrollen vraagt passende software en hardware. Aan de softwarekant komen twee hulpmiddelen in aanmerking: Ollama en LM Studio. Ollama draait op Windows, Linux en macOS, zowel grafisch als in servermodus; met een kaart van NVIDIA of AMD is dat wellicht de beste keuze. LM Studio bestaat alleen als grafische toepassing en past bijzonder goed bij macOS op processoren vanaf de Apple M1.

  • Ollama is een serveromgeving om taalmodellen uit te voeren. Ze draait op de achtergrond, als een dienst, en biedt een eenvoudige API. Haar hoofdtaak is modellen doeltreffend te laden en langdurig uit te voeren. Dat is de juiste keuze als u een model in een toepassing wilt inbouwen of als netwerkdienst wilt aanbieden.
  • LM Studio is een grafische bureaubladtoepassing voor Windows en macOS waarmee u modellen zoekt, downloadt en test in een interface die op een chatassistent lijkt. Het eigene ervan is de functie “Local Server”: met één klik wordt elk geladen model een API-server die compatibel is met OpenAI. Dat is het ideale hulpmiddel om snel te starten, te experimenteren en uw modellen visueel te beheren, zonder opdrachtregel.

💻 Minimale configuratie (om het te laten werken)

OnderdeelVereistenGevolg
Processor (cpu) 4 kernen of meer (Intel i5 / AMD Ryzen 5 / Apple M1 en later). Een moderne architectuur telt zwaarder dan de kloksnelheid. Werkt zonder gpu, maar traag (1 tot 5 tokens per seconde).
Werkgeheugen (RAM) 16 GBminimum. 24 GB en meeraanbevolen voor een stabiele werking. Een 8B-model + het systeem + de toepassingen ≈ 12 tot 14 GB. Met 16 GB is het krap.
Opslag (ssd) Een NVMe-ssd van minstens 256 GB. Een model van 7B-8B neemt 5 tot 10 GB in. Het model wordt snel in het geheugen geladen. Een mechanische harde schijf is hier onbruikbaar.
Systeem Linux (Ubuntu), Windows 10/11, macOS Sonoma en later. Linux levert 10 tot 15 % extra prestaties.

🎮 Aanbevolen configuratie (om comfortabel te werken)

OnderdeelVereistenWat het oplevert
Grafische kaart (gpu) Onmisbaar voor de snelheid.
NVIDIA: GTX 1660 6 GB (minimum), RTX 3060 12 GB (optimaal)
AMD: RX 6700 XT 12 GB en hoger
Apple: M1 Pro / M2 / M3 met 16 GB en meer
Tien- tot vijftigmaal sneller. Het model werkt in het VRAM en laat het werkgeheugen vrij.
Gpu-geheugen (VRAM) Minstens 8 GB voor modellen van 7B. 12 GB en meer aanbevolen voor 8B-14B met wat marge. Hoe meer VRAM, hoe ruimer de context en hoe sneller de verwerking.
Werkgeheugen 32 GB DDR4/DDR5 Marge voor het systeem, de browser en het werk aan documenten.
Processor 8 kernen of meer (Intel i7 / AMD Ryzen 7) Betere verwerking van aanvragen wanneer een deel van het model in het werkgeheugen blijft.

Uit ervaring past een gpu die in de processor is ingebouwd — of de processor alleen — slecht bij AI-taken. U kunt zo natuurlijk een model draaien, maar de ondersteuning van AMD in ROCm blijft zwak. Kaarten van NVIDIA geven de beste resultaten; de gedetailleerde lijst staat in de documentatie van de fabrikant.

Doorgaans beschouw ik de Mac mini met een ARM-processor M1 Pro of recenter als de ideale oplossing voor dit gebruik. U moet gewoon op 32 tot 64 GB geheugen mikken, of zelfs 128 GB: hoe meer, hoe beter. Dat is naar mijn aanvoelen de beste verhouding tussen resultaat en prijs voor een lokale AI — wie had gedacht dat Apple de goedkoopste optie zou zijn.

Het model kiezen

Kies volgens het beschikbare geheugen. Het meest evenwichtige model is in mijn ogen gpt-oss:20b, uitgebracht door OpenAI.

  • Met 16 GB RAM: modellen van 7B tot 8B parameters passen het best, bijvoorbeeld Qwen2.5-7B-Instruct of DeepSeek-R1:8b.
  • Met 32 GB RAM: u kunt stevigere modellen draaien, van 14B tot 20B parameters, bijvoorbeeld DeepSeek-R1:14b voor analyse of gpt-oss:20b voor de beste compatibiliteit met hulpmiddelen.
  • Met 64 GB RAM: het volledige gamma tot 30B-32B parameters komt binnen bereik, met inbegrip van Qwen3:30b en DeepSeek-R1:32b, wat de beste antwoordkwaliteit en de ruimste context geeft.
Vuistregel

Gebruik altijd de Instruct-versies van de modellen en het formaat GGUF, dat compatibiliteit waarborgt.

De zoekbalk van Open WebUI die aanbiedt gpt-oss:20b te downloaden van Ollama.com
In Open WebUI volstaat het de naam van het model in te tikken: de interface biedt aan het van Ollama.com te downloaden.

Ollama installeren

Stel dat u een pc met Linux Ubuntu hebt en het daarop wilt proberen. Zelf heb ik de test gedaan op een Aoostar WTR Pro met de hypervisor Proxmox: daarop heb ik een virtuele machine gemaakt met 8 kernen en 16 GB werkgeheugen.

De rest is eenvoudig: installeer Ollama met een webinterface, die handiger is om te beheren.

Opdrachten:

sudo apt update
sudo apt upgrade
sudo apt install docker.io docker-compose -y
sudo systemctl enable --now docker
sudo usermod -aG docker $USER
sudo reboot

Laten we nu de map voor Ollama klaarmaken:

cd /opt/
sudo mkdir ollama
sudo chown $USER ollama
cd ollama/

Maak met nano docker-compose.yml een bestand met de volgende inhoud:

version: '3.8'
services:
  ollama-webui:
    image: ghcr.io/open-webui/open-webui:ollama
    container_name: ollama-webui
    restart: unless-stopped
    ports:
      - "11434:11434"  # Poort van de Ollama-API
      - "8080:8080"    # Poort van de webinterface Open WebUI
    environment:
      # Sleutelinstelling: laat verbindingen met de Ollama-API vanaf andere adressen toe
      - OLLAMA_HOST=0.0.0.0
      - OLLAMA_ORIGINS=*
    volumes:
      - ./ollama_data:/root/.ollama          # Opslag van de gedownloade modellen
      - ./openwebui_data:/app/backend/data   # Gegevens van Open WebUI (gesprekken, instellingen)
volumes:
  ollama_data:
  openwebui_data:

Start daarna de container:

docker-compose up -d

Zodra de container draait, opent u de webinterface van Ollama op http://IP:8080. Nadat u een gebruiker hebt gemaakt en zich hebt aangemeld, downloadt u het model gpt-oss:20b of een ander model naar keuze.

LM Studio instellen

Op een Mac is LM Studio de beste keuze, maar het vraagt wat instelwerk. U moet eerst de ontwikkelaarsmodus inschakelen en daarna toestaan dat de server vanaf het lokale netwerk bereikbaar is, zoals op de schermafbeeldingen hieronder.

De instellingen van LM Studio met het interfaceniveau op Ontwikkelaar
Eerste instelling in LM Studio: zet het interfaceniveau op “Ontwikkelaar” zodat het tabblad met de server verschijnt.
De lokale server van LM Studio draait met de verspreiding op het lokale netwerk ingeschakeld
Tweede instelling: start de server en schakel daarna “Op het lokale netwerk aanbieden” in zodat de NAS hem kan bereiken.

Synology AI Console instellen

Om de lokale AI aan de NAS te koppelen, opent u Synology AI Console en voegt u een nieuwe integratie toe. Geef ze een naam, kies de interface “OpenAI-compatibele API” en vul een URL in van de vorm http://IP:11434/v1. Klik daarna op “De lijst met generatieve modellen ophalen”: het systeem geeft alle geladen modellen terug. Kies het model dat u wilt. Neem voor het contextvenster en de uitvoertokens minstens 8192 en 4096. Hoe hoger, hoe beter, maar alles hangt van uw hardware af.

Een API-integratie van Synology AI Console die naar een lokale Ollama-server wijst
De volledige integratie: basis-URL van de lokale server, ophalen van de lijst met modellen, contextvenster en uitvoertokens.

Het resultaat controleren

Klopt alles, dan worden de AI-functies bruikbaar in Synology Office en Synology MailPlus. Ze draaien lokaal, blijven volledig vertrouwelijk, en hun snelheid hangt nog alleen van uw hardware af.

De AI-assistent van Synology Office die tekst schrijft in een document
In Synology Office schrijft de assistent op basis van een opdracht — de verwerking blijft op de lokale machine.
Een uitgebreide samenvatting van een e-mailgesprek in Synology MailPlus
In MailPlus neemt de uitgebreide samenvatting de vraag, de genoemde voorwaarden en de uitgewisselde contactgegevens over.

Daarmee is het rond. U weet nu hoe u Synology AI koppelt aan een lokaal taalmodel dat door Ollama of LM Studio wordt uitgevoerd.

Bronnen

Over de auteur

Jeremy Kraft beheert de infrastructuur en de zelfgehoste diensten van het IBCSC. Deze gidsen beschrijven configuraties die echt zijn uitgerold en voor publicatie opnieuw zijn nagekeken.

Discussie

Reacties

0

Nog geen reacties. U kunt de discussie openen met een vraag of uw eigen ervaring.