Connecter Synology AI à un LLM local avec Ollama ou LM Studio
Exécuter un modèle de langage chez soi, l’exposer en API compatible OpenAI et le raccorder à Synology AI Console pour alimenter MailPlus et Office sans service en ligne.
Ce guide explique comment connecter Synology AI à un modèle de langage exécuté chez vous, avec Ollama ou LM Studio, afin d’utiliser les fonctions d’IA de DSM sans dépendre d’un service en ligne.
Introduction
L’objectif de ce texte est de montrer comment raccorder une IA locale à Synology AI, rien de plus. J’y ajoute quelques conclusions personnelles et des recommandations de matériel et de logiciel, mais ce sont des à-côtés destinés à rendre le propos complet.
Synology ne développe pas son propre modèle d’IA. En revanche, la société fournit une interface, Synology AI Console, qui permet d’y raccorder des modèles tiers. D’autres constructeurs suivent une approche comparable, mais Synology l’a mise en œuvre assez tôt.
La plupart des modèles hébergés dans le cloud impliquent un abonnement ou une facturation à l’usage de leur API, ainsi qu’un transfert de vos contenus vers l’infrastructure d’un tiers. Pour un serveur d’entreprise ou un NAS familial, ces deux points suffisent souvent à écarter la solution.
Coïncidence ou non, une mise à jour de Synology AI Console a rendu possible le raccordement de n’importe quel modèle compatible avec l’API OpenAI, y compris un modèle local. C’est exactement ce que je montre ici. Le bénéfice supplémentaire est la confidentialité : les données ne partent pas vers un service externe, elles restent dans votre écosystème.
Le fonctionnement des fonctions d’IA côté applications est traité séparément, dans les guides consacrés à Synology MailPlus et à Synology Office.
Configuration requise
Déployer une IA locale suppose un logiciel et un matériel adaptés. Côté logiciel, deux outils conviennent : Ollama et LM Studio. Ollama s’exécute sous Windows, Linux et macOS, en mode graphique comme en mode serveur ; c’est probablement le meilleur choix avec une carte NVIDIA ou AMD. LM Studio n’existe qu’en version graphique et convient idéalement à macOS sur processeurs Apple M1 et plus récents.
- Ollama est un moteur serveur destiné à exécuter des modèles de langage. Il tourne en arrière-plan, comme un service, et expose une API simple. Sa fonction principale est de charger et d’exécuter des modèles efficacement, sur de longues durées. C’est le choix pertinent si vous voulez intégrer un modèle dans une application ou le publier comme service réseau.
- LM Studio est une application de bureau graphique pour Windows et macOS, qui permet de chercher, télécharger et tester des modèles dans une interface proche de celle d’un agent conversationnel. Sa particularité est la fonction « Local Server » : en un clic, n’importe quel modèle chargé devient un serveur d’API compatible OpenAI. C’est l’outil idéal pour démarrer vite, expérimenter et gérer visuellement ses modèles sans ligne de commande.
💻 Configuration minimale (pour que ça fonctionne)
| Composant | Exigences | Conséquence |
|---|---|---|
| Processeur (CPU) | 4 cœurs ou plus (Intel i5 / AMD Ryzen 5 / Apple M1 et suivants). L’architecture moderne compte davantage que la fréquence. | Fonctionne sans GPU, mais lentement (1 à 5 jetons par seconde). |
| Mémoire vive (RAM) | 16 Go — minimum. 24 Go et plus — recommandé pour un fonctionnement stable. | Un modèle 8B + le système + les applications ≈ 12 à 14 Go. Avec 16 Go, c’est juste. |
| Stockage (SSD) | SSD NVMe d’au moins 256 Go. Un modèle 7B-8B occupe 5 à 10 Go. | Chargement rapide du modèle en mémoire. Un disque dur mécanique est inutilisable ici. |
| Système | Linux (Ubuntu), Windows 10/11, macOS Sonoma et suivants. | Linux apporte 10 à 15 % de performances supplémentaires. |
🎮 Configuration recommandée (pour travailler confortablement)
| Composant | Exigences | Apport |
|---|---|---|
| Carte graphique (GPU) | Indispensable pour la vitesse. • NVIDIA : GTX 1660 6 Go (minimum), RTX 3060 12 Go (optimal) • AMD : RX 6700 XT 12 Go et plus • Apple : M1 Pro / M2 / M3 avec 16 Go et plus |
Accélération d’un facteur 10 à 50. Le modèle travaille en VRAM et libère la mémoire vive. |
| Mémoire GPU (VRAM) | 8 Go minimum pour les modèles 7B. 12 Go et plus recommandés pour du 8B-14B avec de la marge. | Plus la VRAM est grande, plus le contexte est large et le traitement rapide. |
| Mémoire vive | 32 Go DDR4/DDR5 | De la marge pour le système, le navigateur et le travail sur les documents. |
| Processeur | 8 cœurs ou plus (Intel i7 / AMD Ryzen 7) | Meilleur traitement des requêtes lorsqu’une partie du modèle reste en mémoire vive. |
D’expérience, un GPU intégré au processeur — ou le processeur seul — convient mal aux tâches d’IA. On peut évidemment exécuter un modèle ainsi, mais la prise en charge d’AMD dans ROCm reste faible. Les cartes NVIDIA donnent les meilleurs résultats ; la liste détaillée figure dans la documentation du constructeur.
De manière générale, je considère le Mac mini à processeur ARM M1 Pro ou plus récent comme la solution idéale pour cet usage. Il faut simplement viser 32 à 64 Go de mémoire, voire 128 Go : plus il y en a, mieux c’est. C’est à mon sens le meilleur rapport résultat/prix pour une IA locale — qui aurait cru qu’Apple serait l’option la moins chère.
Choix du modèle
Choisissez en fonction de la mémoire disponible. Le modèle le plus équilibré à mes yeux est gpt-oss:20b, publié par OpenAI.
- Avec 16 Go de RAM : les modèles de 7B à 8B paramètres sont les plus adaptés, par exemple Qwen2.5-7B-Instruct ou DeepSeek-R1:8b.
- Avec 32 Go de RAM : vous pouvez faire tourner des modèles plus solides, de 14B à 20B paramètres, par exemple DeepSeek-R1:14b pour l’analyse ou gpt-oss:20b pour la meilleure compatibilité avec les outils.
- Avec 64 Go de RAM : tout le spectre jusqu’à 30B-32B paramètres devient accessible, y compris Qwen3:30b et DeepSeek-R1:32b, ce qui donne la meilleure qualité de réponse et le contexte le plus large.
Utilisez toujours les versions Instruct des modèles et le format GGUF, gage de compatibilité.
Installation d’Ollama
Admettons que vous disposiez d’un PC sous Linux Ubuntu et que vous vouliez l’essayer dessus. De mon côté, j’ai fait le test sur un Aoostar WTR Pro équipé de l’hyperviseur Proxmox : j’y ai créé une machine virtuelle à laquelle j’ai attribué 8 cœurs et 16 Go de mémoire vive.
La suite est simple : il faut installer Ollama avec une interface web, plus commode à administrer.
Commandes :
sudo apt update
sudo apt upgrade
sudo apt install docker.io docker-compose -y
sudo systemctl enable --now docker
sudo usermod -aG docker $USER
sudo reboot
Préparons maintenant le dossier destiné à Ollama :
cd /opt/
sudo mkdir ollama
sudo chown $USER ollama
cd ollama/
Créez un fichier nano docker-compose.yml avec le contenu suivant :
version: '3.8'
services:
ollama-webui:
image: ghcr.io/open-webui/open-webui:ollama
container_name: ollama-webui
restart: unless-stopped
ports:
- "11434:11434" # Port de l'API Ollama
- "8080:8080" # Port de l'interface web Open WebUI
environment:
# Réglage clé : autorise les connexions à l'API Ollama depuis d'autres adresses
- OLLAMA_HOST=0.0.0.0
- OLLAMA_ORIGINS=*
volumes:
- ./ollama_data:/root/.ollama # Stockage des modèles téléchargés
- ./openwebui_data:/app/backend/data # Données d'Open WebUI (conversations, réglages)
volumes:
ollama_data:
openwebui_data:
Puis démarrez le conteneur :
docker-compose up -d
Une fois le conteneur déployé, ouvrez l’interface web d’Ollama à l’adresse http://IP:8080. Après avoir créé un utilisateur et vous être connecté, téléchargez le modèle gpt-oss:20b ou tout autre modèle de votre choix.
Configuration de LM Studio
Sur un Mac, LM Studio est le meilleur choix, mais il demande une configuration. Il faut d’abord activer le mode développeur, puis autoriser le serveur à être joint depuis le réseau local, comme sur les captures ci-dessous.
Configuration de Synology AI Console
Pour raccorder l’IA locale au NAS, ouvrez Synology AI Console et ajoutez une nouvelle intégration. Donnez-lui un nom, choisissez l’interface « API compatible OpenAI » et indiquez une URL de la forme http://IP:11434/v1. Cliquez ensuite sur « Obtenir la liste des modèles génératifs » : le système renvoie tous les modèles chargés. Sélectionnez celui qui vous intéresse. Pour la fenêtre de contexte et les jetons de sortie, retenez au minimum 8192 et 4096. Plus c’est élevé, mieux c’est, mais tout dépend de votre matériel.
Vérification du résultat
Si tout est correct, les fonctions d’IA deviennent utilisables dans Synology Office et Synology MailPlus. Elles s’exécutent localement, restent entièrement confidentielles, et leur rapidité ne dépend plus que de votre matériel.
C’est terminé. Vous savez désormais comment raccorder Synology AI à un modèle de langage local exécuté par Ollama ou LM Studio.
Discussion
Commentaires
Aucun commentaire pour le moment. Vous pouvez ouvrir la discussion avec une question ou un retour d’expérience.
La connexion protège les échanges du spam et évite de publier votre adresse e-mail.
Se connecter pour commenter →