D-OPEN

Comment deployer un modele IA open source sur un serveur local pour votre PME en 8 etapes

Clara Moreau

Clara Moreau

Architecte cloud et DevOps · 21 juin 2026 · 13 min de lecture

TL;DR

  • • Les modeles IA open source (Llama 3.1, Mistral, Phi-4) sont desormais suffisamment performants pour remplacer les API cloud dans la plupart des cas d usage PME : chatbot interne, analyse documentaire, generation de contenu, assistance technique.
  • • Un serveur local avec un GPU NVIDIA RTX 4070 Ti (12 Go VRAM, environ 800 euros) fait tourner un modele 7B a 60+ tokens/seconde — largement suffisant pour 5-10 utilisateurs simultanement. Le cout annuel est 10x inferieur aux API cloud.
  • • Ce guide couvre les 8 etapes completes : evaluation des besoins, choix du modele, dimensionnement serveur, installation Docker/CUDA, configuration Ollama/vLLM, securisation reseau, integration API, et monitoring en production.

En 2026, une PME francaise n'a plus besoin d'envoyer ses donnees chez OpenAI ou Google pour exploiter l'intelligence artificielle. Les modeles open source ont atteint un niveau de maturite qui les rend viables pour la production : Llama 3.1 70B rivalise avec GPT-4 sur la plupart des benchmarks, Mistral Small 4 surpasse Claude Haiku sur le raisonnement technique, et Phi-4 Mini offre des performances remarquables pour un modele de seulement 3,8 milliards de parametres. Le tout sans abonnement mensuel, sans limite de tokens, et avec une garantie absolue de confidentialite des donnees.

Pourtant, la majorite des PME hesitent encore. Les freins sont toujours les memes : complexite percue du deploiement, incertitude sur le materiel necessaire, inquietude sur la maintenance. Ce guide elimine ces barrieres. En 8 etapes concretes, avec des commandes copiables et des configurations testees sur du materiel accessible, vous allez passer d'un serveur vierge a un modele IA operationnel integre a vos outils metier. Et comme nous l'avons demontre dans notre guide sur le deploiement Ollama en production securisee, la cle reside dans une approche methodique et incrementale.

ARCHITECTURE DEPLOIEMENT IA OPEN SOURCE — PME ON-PREMISEUTILISATEURS INTERNESNavigateur / Chatbot5-10 utilisateurs simultanesOUTILS METIERERP / CRM / IntranetIntegration via API RESTAPI GATEWAYNginx reverse proxyAuth Bearer Token + Rate LimitTLS interne + CORSLoad balancing round-robinPort 8080 — reseau local uniquementMOTEUR D'INFERENCEOllama / vLLM / llama.cppAPI compatible OpenAIMODELES CHARGESLlama 3.1 8B | Mistral 7B | Phi-4GPU NVIDIACUDA 12.xRAM 64 GoDDR5 ECCSTOCKAGE LOCALSSD NVMe 1 To — modeles GGUFBackup quotidien NAS / S3 compatibleMONITORINGPrometheus + GrafanaGPU temp | Latence | Tokens/sAlertes Slack / EmailPARE-FEU RESEAUufw — port 8080 LAN onlyAucun port expose sur InternetVLAN dedie IA (recommande)INFRASTRUCTURE 100% ON-PREMISEAucune donnee ne quitte le reseau local — conformite RGPD native

Etape 1 — Evaluer les besoins IA de votre PME

Avant d'acheter le moindre materiel, posez-vous les bonnes questions. L'erreur classique des PME est de vouloir deployer le modele le plus gros possible sans avoir clarifie le cas d'usage concret. Un modele 70B est spectaculaire en demo, mais un modele 7B bien configure resout 90% des problemes operationnels d'une PME avec un materiel dix fois moins couteux.

Commencez par lister vos cas d'usage prioritaires. Les plus courants en PME francaise sont : assistant de redaction (emails, rapports, comptes-rendus), chatbot de support client interne, analyse et synthese de documents (contrats, appels d'offres, cahiers des charges), generation de code ou de scripts, et traduction technique. Chaque cas d'usage a des exigences differentes. Un assistant de redaction a besoin de vitesse (reponse en moins de 2 secondes) mais tolere un modele plus petit. Une analyse de documents complexes exige un modele plus gros avec une fenetre de contexte etendue (32K tokens minimum).

Estimez ensuite le volume d'utilisation. Combien d'utilisateurs simultanement ? Combien de requetes par heure ? Un departement de 5 personnes utilisant l'IA pour de la redaction represente environ 20-50 requetes par heure aux heures de pointe. Un chatbot de support client interne accessible a 50 employes peut generer 100-200 requetes par heure. Ces chiffres determinent directement le dimensionnement serveur de l'etape 3.

Enfin, evaluez vos contraintes de confidentialite. Si vous manipulez des donnees personnelles (RH, clients), des secrets industriels, ou des documents sous NDA, le deploiement local n'est pas optionnel — c'est une obligation. Le RGPD impose que le traitement des donnees personnelles par l'IA soit documente dans votre registre des traitements, et un deploiement on-premise simplifie considerablement la conformite par rapport a une API cloud hebergee aux Etats-Unis.

Etape 2 — Choisir le bon modele open source

Le choix du modele est la decision la plus structurante. En juin 2026, l'ecosysteme open source offre des dizaines d'options, mais quatre familles se distinguent pour les deploiements PME :

Llama 3.1 (Meta) : Le choix le plus polyvalent. Disponible en 8B, 70B et 405B parametres. Le 8B est excellent pour la redaction et le chat. Le 70B rivalise avec GPT-4 sur les taches de raisonnement complexe. Fenetre de contexte de 128K tokens. Licence permissive pour un usage commercial. C'est le modele que nous recommandons par defaut pour la plupart des PME.

Mistral (Mistral AI) : Le champion francais. Mistral 7B et Mistral Small 4 offrent un excellent rapport qualite/taille, particulierement pour les taches en francais. La comprehension des nuances linguistiques francaises est superieure a celle de Llama. Mistral Nemo (12B) est un excellent compromis entre taille et qualite. Notre guide sur le deploiement de Mistral Medium 3.5 detaille la configuration avancee avec vLLM.

Phi-4 (Microsoft) : Le modele compact le plus impressionnant. Avec seulement 14B parametres, il offre des performances comparables a des modeles 2-3x plus gros sur le raisonnement logique et mathematique. Phi-4 Mini (3,8B) est ideal pour les PME qui veulent demarrer avec du materiel minimal — il tourne confortablement sur un CPU moderne sans GPU.

Qwen 2.5 (Alibaba) : Excellent pour les taches de code et les applications multilingues. Le Qwen 2.5 Coder 32B est le meilleur modele open source pour la generation et l'explication de code. Disponible en tailles de 0,5B a 72B, il couvre tous les budgets materiels.

💡 Notre avis d'expert

"Pour une PME qui debute, notre recommandation est claire : commencez par Llama 3.1 8B ou Mistral 7B. Ces modeles offrent 80% de la qualite d'un GPT-4 pour 5% du cout. Une fois l'infrastructure validee et les usages confirmes, vous pourrez facilement passer au 70B sans modifier l'architecture — seul le GPU changera."

Etape 3 — Dimensionner le serveur (CPU, GPU, RAM, stockage)

Le dimensionnement materiel depend directement du modele choisi a l'etape 2. Voici les configurations recommandees, testees en conditions reelles dans des PME francaises :

Configuration budget (modeles 3-7B, 1500-2500 euros) : CPU AMD Ryzen 9 7900X ou Intel Core i7-14700K, 32 Go de RAM DDR5, SSD NVMe 500 Go, GPU NVIDIA RTX 4060 Ti 16 Go. Cette configuration fait tourner Mistral 7B en quantification Q4_K_M a 45-55 tokens/seconde. Suffisant pour 3-5 utilisateurs simultanement. Sans GPU, le meme modele produit 8-12 tokens/seconde en CPU — acceptable pour un usage individuel.

Configuration intermediaire (modeles 7-13B, 3000-5000 euros) : CPU AMD Ryzen 9 7950X, 64 Go de RAM DDR5, SSD NVMe 1 To, GPU NVIDIA RTX 4070 Ti Super 16 Go ou RTX 4080 16 Go. Cette configuration permet de faire tourner Llama 3.1 8B en pleine precision ou des modeles 13B en quantification Q5. Debit de 50-70 tokens/seconde. Recommande pour 5-10 utilisateurs simultanement.

Configuration performance (modeles 30-70B, 6000-12000 euros) : CPU AMD EPYC ou Intel Xeon, 128 Go de RAM DDR5 ECC, SSD NVMe 2 To, GPU NVIDIA RTX A6000 48 Go ou 2x RTX 4090 24 Go. Necessaire pour faire tourner Llama 3.1 70B en quantification Q4. Le 70B quantifie occupe environ 35-40 Go de VRAM. Debit de 20-35 tokens/seconde. Pour les PME qui ont besoin de la qualite maximale sur des taches complexes.

Un point crucial souvent neglige : le stockage. Les modeles GGUF quantifies pesent entre 2 Go (Phi-4 Mini Q4) et 40 Go (Llama 3.1 70B Q4). Prevoyez au minimum 200 Go d'espace libre pour stocker plusieurs modeles et pouvoir basculer entre eux rapidement. Un SSD NVMe est indispensable — le chargement d'un modele depuis un disque dur mecanique peut prendre plusieurs minutes au lieu de quelques secondes.

Etape 4 — Installer l'environnement (Docker, CUDA/ROCm, Python)

Nous recommandons Ubuntu Server 24.04 LTS comme systeme d'exploitation. C'est la distribution la mieux supportee par les pilotes NVIDIA, Docker, et les frameworks d'inference IA. Voici la sequence d'installation complete :

# 1. Mise a jour systeme
sudo apt update && sudo apt upgrade -y

# 2. Installer les pilotes NVIDIA (si GPU)
sudo apt install -y nvidia-driver-560 nvidia-utils-560
sudo reboot
# Verifier : nvidia-smi doit afficher votre GPU

# 3. Installer Docker + NVIDIA Container Toolkit
sudo apt install -y docker.io docker-compose-v2
sudo systemctl enable --now docker

# Toolkit NVIDIA pour Docker
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey \
  | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container.gpg
curl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list \
  | sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container.gpg] https://#g' \
  | sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
sudo apt update && sudo apt install -y nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

# 4. Verifier l'acces GPU dans Docker
docker run --rm --gpus all nvidia/cuda:12.4.1-base-ubuntu22.04 nvidia-smi

# 5. Installer Python 3.12 + uv (gestionnaire de paquets)
sudo apt install -y python3.12 python3.12-venv
curl -LsSf https://astral.sh/uv/install.sh | sh

Si vous utilisez un GPU AMD (Radeon RX 7900 XTX, par exemple), remplacez les pilotes NVIDIA par ROCm 6.x. Le support est fonctionnel mais requiert plus de configuration manuelle. Pour les PME, nous recommandons de rester sur NVIDIA — l'ecosysteme CUDA est significativement plus mature pour l'inference LLM. Si vous souhaitez approfondir la configuration Python securisee, notre article sur la configuration d'un environnement Python avec uv couvre les bonnes pratiques.

Etape 5 — Telecharger et configurer le modele

Trois outils dominent l'inference locale en 2026. Le choix depend de votre priorite : simplicite, performance, ou controle granulaire.

Option A : Ollama (recommande pour debuter)

Ollama est le choix ideal pour une PME qui debute. Une seule commande pour installer, une autre pour lancer un modele. L'API est nativement compatible avec le format OpenAI, ce qui facilite l'integration avec les outils existants :

# Installation Ollama via Docker (recommande pour la production)
docker run -d \
  --name ollama \
  --gpus all \
  -v ollama-data:/root/.ollama \
  -p 11434:11434 \
  --restart unless-stopped \
  ollama/ollama:latest

# Telecharger les modeles
docker exec ollama ollama pull llama3.1:8b
docker exec ollama ollama pull mistral:7b
docker exec ollama ollama pull phi4-mini

# Tester le modele
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.1:8b",
  "prompt": "Explique le RGPD en 3 phrases pour un dirigeant de PME.",
  "stream": false
}'

# Utiliser l'API compatible OpenAI
curl http://localhost:11434/v1/chat/completions -d '{
  "model": "llama3.1:8b",
  "messages": [{"role": "user", "content": "Resume ce contrat en 5 points cles."}]
}'

Option B : vLLM (performance maximale)

Pour les PME avec une charge plus importante (plus de 50 requetes par minute), vLLM offre des performances superieures grace au PagedAttention et au batching continu. Le debit est 2-3x superieur a Ollama sur la meme configuration materielle :

# vLLM via Docker
docker run -d \
  --name vllm \
  --gpus all \
  -v vllm-models:/models \
  -p 8000:8000 \
  vllm/vllm-openai:latest \
  --model mistralai/Mistral-7B-Instruct-v0.3 \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.9

# L'API est directement compatible OpenAI
curl http://localhost:8000/v1/chat/completions -d '{
  "model": "mistralai/Mistral-7B-Instruct-v0.3",
  "messages": [{"role": "user", "content": "Votre question ici"}],
  "max_tokens": 512
}'

Option C : llama.cpp (controle maximal)

Pour les PME qui veulent une empreinte minimale ou qui deploient sur du materiel atypique (CPU uniquement, GPU AMD, Apple Silicon), llama.cpp offre le plus de flexibilite. Il lit directement les fichiers GGUF et expose un serveur HTTP minimal :

# llama.cpp serveur — telechargez le modele GGUF depuis HuggingFace
docker run -d \
  --name llamacpp \
  --gpus all \
  -v /chemin/vers/modeles:/models \
  -p 8080:8080 \
  ghcr.io/ggerganov/llama.cpp:server \
  --model /models/llama-3.1-8b-instruct-q4_k_m.gguf \
  --ctx-size 8192 \
  --n-gpu-layers 99 \
  --host 0.0.0.0 --port 8080

💡 Notre avis d'expert

"Ne perdez pas de temps a comparer les trois outils pendant des semaines. Installez Ollama, testez vos cas d'usage pendant une semaine, et ne migrez vers vLLM que si vous constatez un goulot d'etranglement reel sur les performances. 95% des PME que nous accompagnons restent sur Ollama — la simplicite operationnelle vaut plus que les 30% de debit supplementaire de vLLM."

Etape 6 — Securiser l'acces et configurer le reseau interne

C'est l'etape que les PME negligent le plus — et c'est la plus critique. Un modele IA expose sans protection sur le reseau est une faille de securite beante. La vulnerabilite Bleeding Llama (CVE-2026-7482) a montre que plus de 300 000 serveurs Ollama etaient accessibles depuis Internet sans aucune authentification. Ne commettez pas cette erreur.

Voici les trois couches de securite a implementer systematiquement :

Couche 1 : Pare-feu. Le serveur IA ne doit jamais etre accessible depuis Internet. Configurez ufw pour n'accepter les connexions que depuis les adresses IP de votre reseau local :

# Pare-feu : uniquement le reseau local
sudo ufw default deny incoming
sudo ufw default allow outgoing
sudo ufw allow from 192.168.1.0/24 to any port 8080  # API IA
sudo ufw allow from 192.168.1.0/24 to any port 22    # SSH admin
sudo ufw enable

Couche 2 : Reverse proxy avec authentification. Placez un Nginx devant le moteur d'inference pour ajouter l'authentification par Bearer token, le rate limiting, et les headers de securite :

# nginx.conf — reverse proxy securise
upstream ollama_backend {
    server 127.0.0.1:11434;
}

server {
    listen 8080;
    server_name ia.local;

    # Rate limiting : 30 requetes/minute par IP
    limit_req_zone $binary_remote_addr zone=ia_limit:10m rate=30r/m;

    location /v1/ {
        # Authentification Bearer
        if ($http_authorization != "Bearer VOTRE_TOKEN_SECRET_ICI") {
            return 401;
        }

        limit_req zone=ia_limit burst=10 nodelay;
        proxy_pass http://ollama_backend;
        proxy_set_header Host $host;
        proxy_read_timeout 120s;  # Les reponses LLM prennent du temps
    }
}

Couche 3 : Isolation Docker. Le conteneur du moteur d'inference doit fonctionner dans un reseau Docker isole. Ne mappez pas les ports directement sur l'interface reseau publique — seul le reverse proxy doit etre accessible :

# docker-compose.yml — stack securise
services:
  ollama:
    image: ollama/ollama:latest
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    volumes:
      - ollama-data:/root/.ollama
    networks:
      - ia-internal
    # PAS de ports: — inaccessible depuis l'exterieur

  nginx:
    image: nginx:alpine
    ports:
      - "192.168.1.100:8080:8080"  # Ecoute LAN uniquement
    volumes:
      - ./nginx.conf:/etc/nginx/conf.d/default.conf:ro
    networks:
      - ia-internal
    depends_on:
      - ollama

networks:
  ia-internal:
    driver: bridge
    internal: false

volumes:
  ollama-data:

Pour une securisation approfondie incluant les certificats TLS internes et les audits de vulnerabilites, consultez notre guide detaille sur le deploiement Ollama en production securisee avec Docker.

PIPELINE DE DEPLOIEMENT — DE ZERO A PRODUCTION EN 8 ETAPESPHASE 1 — PREPARATION1.Evaluer besoins + cas d'usage2.Choisir modele (Llama/Mistral/Phi)3.Dimensionner serveur (GPU/RAM)PHASE 2 — INSTALLATION4.Docker + CUDA + Python5.Ollama/vLLM + modele GGUF6.Securite reseau + authPHASE 3 — PRODUCTION7.Integrer API + outils metier8.Monitorer + maintenirIA operationnelle en PMEJour 1-2Jour 2-3Jour 3-5PREREQUIS MATERIELSGPU NVIDIA 16 Go+ VRAM (ou CPU 32 Go RAM)SSD NVMe 500 Go+ | Ubuntu 24.04 LTSReseau local avec acces adminPIEGES COURANTS A EVITERExposer Ollama sur Internet sans authSous-dimensionner la RAM (modele swap = 100x plus lent)Ignorer les mises a jour de securite du moteur

Etape 7 — Integrer le modele dans vos outils metier

Un modele IA qui tourne dans un terminal n'a aucune valeur metier. La vraie valeur emerge quand il est integre dans les outils que vos equipes utilisent quotidiennement. Trois strategies d'integration couvrent 95% des besoins d'une PME :

Integration 1 : Chatbot interne (interface web)

Deployez Open WebUI (anciennement Ollama WebUI) pour offrir a vos equipes une interface de chat identique a ChatGPT, mais connectee a votre modele local. L'installation prend 5 minutes :

# Open WebUI — interface ChatGPT-like pour Ollama
docker run -d \
  --name open-webui \
  --network ia-internal \
  -p 192.168.1.100:3000:8080 \
  -v open-webui-data:/app/backend/data \
  -e OLLAMA_BASE_URL=http://ollama:11434 \
  ghcr.io/open-webui/open-webui:main

# Accessible sur http://192.168.1.100:3000
# Gestion des utilisateurs, historique, RAG integre

Integration 2 : API REST pour vos applications

Ollama et vLLM exposent une API compatible OpenAI. Cela signifie que n'importe quelle application utilisant le SDK OpenAI peut pointer vers votre serveur local en changeant simplement l'URL de base. Voici un exemple en Python pour integrer l'IA dans un script de traitement de documents :

# script_analyse_documents.py
from openai import OpenAI

# Pointer vers votre serveur local au lieu d'OpenAI
client = OpenAI(
    base_url="http://192.168.1.100:8080/v1",
    api_key="votre-token-bearer"  # Le token du reverse proxy
)

def analyser_document(texte: str) -> str:
    """Genere un resume structure d'un document."""
    response = client.chat.completions.create(
        model="llama3.1:8b",
        messages=[
            {"role": "system", "content": "Tu es un assistant juridique. Resume les documents de facon structuree avec les points cles, risques identifies et actions recommandees."},
            {"role": "user", "content": f"Resume ce document :\n\n{texte}"}
        ],
        max_tokens=1024,
        temperature=0.3  # Basse temperature pour la precision
    )
    return response.choices[0].message.content

# Utilisation
with open("contrat-fournisseur.txt", "r") as f:
    resume = analyser_document(f.read())
    print(resume)

Integration 3 : Automatisation via n8n ou Make

Pour les equipes non techniques, connectez votre modele IA a un outil d'automatisation comme n8n (open source, auto-heberge). Exemples de workflows : analyser automatiquement les emails entrants et generer des brouillons de reponse, resumer les comptes-rendus de reunion envoyes par email, classer les tickets de support par priorite et categorie, ou generer des descriptions produit a partir de fiches techniques. n8n supporte nativement les appels API REST vers un endpoint OpenAI-compatible — pointez-le vers votre serveur Ollama local et vos donnees ne quittent jamais votre reseau.

Etape 8 — Monitorer, maintenir et mettre a jour

Un deploiement IA sans monitoring est un deploiement qui va tomber en silence. Trois metriques sont critiques a surveiller en permanence :

Temperature et utilisation GPU : Un GPU qui depasse 85 degres C de facon prolongee degrade ses performances (thermal throttling) et reduit sa duree de vie. Configurez une alerte a 80 degres C. La commande nvidia-smi --query-gpu=temperature.gpu,utilization.gpu --format=csv -l 5 surveille en temps reel.

Latence des reponses : Mesurez le temps entre la requete et le premier token (Time to First Token, TTFT) et le debit total (tokens/seconde). Un TTFT superieur a 3 secondes indique un probleme de charge ou de memoire. Un debit inferieur a 10 tokens/seconde signifie que le modele swap sur le disque — il faut reduire la taille du modele ou ajouter de la VRAM.

Utilisation disque : Les modeles occupent beaucoup d'espace et les logs d'inference s'accumulent rapidement. Configurez une rotation des logs et une alerte quand le disque depasse 80% de capacite. Voici un script de monitoring minimal avec Prometheus :

# docker-compose.monitoring.yml
services:
  prometheus:
    image: prom/prometheus:latest
    volumes:
      - ./prometheus.yml:/etc/prometheus/prometheus.yml:ro
    ports:
      - "192.168.1.100:9090:9090"
    networks:
      - ia-internal

  grafana:
    image: grafana/grafana:latest
    volumes:
      - grafana-data:/var/lib/grafana
    ports:
      - "192.168.1.100:3001:3000"
    environment:
      - GF_SECURITY_ADMIN_PASSWORD=votre-mot-de-passe
    networks:
      - ia-internal

  nvidia-exporter:
    image: utkuozdemir/nvidia_gpu_exporter:latest
    devices:
      - /dev/nvidiactl
      - /dev/nvidia0
    volumes:
      - /usr/bin/nvidia-smi:/usr/bin/nvidia-smi:ro
      - /usr/lib/x86_64-linux-gnu/libnvidia-ml.so.1:/usr/lib/x86_64-linux-gnu/libnvidia-ml.so.1:ro
    ports:
      - "9835:9835"
    networks:
      - ia-internal

Pour la maintenance reguliere, etablissez un calendrier simple : hebdomadaire pour les mises a jour de securite du systeme (apt update && apt upgrade), mensuelle pour les mises a jour d'Ollama/vLLM et les images Docker, trimestrielle pour evaluer les nouveaux modeles disponibles et tester si un upgrade ameliore la qualite des reponses. Les modeles open source evoluent rapidement — un modele sorti il y a 6 mois est souvent depasse par un nouveau modele 2x plus petit mais plus performant.

Pensez aussi a la sauvegarde. Les configurations personnalisees (system prompts, Modelfiles Ollama, fine-tunings eventuels) doivent etre versionnees dans un depot Git. Les volumes Docker contenant les modeles telecharges doivent etre sauvegardes sur un NAS ou un stockage objet compatible S3. Un script de restauration teste permet de reconstruire l'integralite du stack en moins de 30 minutes en cas de panne materielle.

FAQ

Quel budget prevoir pour deployer un modele IA open source en PME ?

Le budget varie selon l'ambition. Pour un deploiement CPU uniquement avec des modeles compacts (Phi-4 Mini, Llama 3.2 3B), un serveur a 800-1500 euros suffit (32 Go RAM, SSD NVMe). Pour un deploiement GPU avec des modeles 7B-13B, comptez 2000-4000 euros pour une carte NVIDIA RTX 4060 Ti ou RTX 4070 Ti. Pour des modeles 70B+, une NVIDIA A6000 (48 Go VRAM) coute environ 5000 euros. Les couts recurrents se limitent a l'electricite (50-100 euros par mois) et a la maintenance systeme. C'est 5 a 20 fois moins cher que les API cloud sur un an pour un usage intensif.

Faut-il obligatoirement un GPU pour faire tourner un LLM en local ?

Non, mais les performances different enormement. En CPU uniquement, les modeles quantifies en Q4_K_M offrent des vitesses de 5-15 tokens par seconde sur un processeur moderne (AMD Ryzen 9, Intel Core i9). C'est acceptable pour un usage interne avec quelques utilisateurs. Un GPU NVIDIA avec 16 Go de VRAM atteint 40-80 tokens par seconde sur les memes modeles. Pour un chatbot interne servant 5-10 utilisateurs simultanement, le GPU devient indispensable. Les GPU AMD (ROCm) fonctionnent aussi mais le support logiciel reste moins mature que CUDA.

Quelle difference entre Ollama, vLLM et llama.cpp pour le deploiement en PME ?

Ollama est le plus simple : une seule commande pour telecharger et lancer un modele, API compatible OpenAI integree, ideal pour les PME sans expertise DevOps avancee. vLLM excelle en performance pure avec le PagedAttention et le batching continu, recommande pour les deploiements a forte charge (plus de 50 requetes par minute). llama.cpp offre le plus de controle avec une empreinte minimale, parfait pour les configurations CPU uniquement ou les GPU avec peu de VRAM. Pour une PME qui debute, nous recommandons Ollama pour sa simplicite, avec une migration possible vers vLLM quand la charge augmente.

Le deploiement local est-il conforme au RGPD ?

Oui, et c'est meme l'une de ses forces majeures. Avec un deploiement on-premise, aucune donnee ne quitte votre infrastructure. Les prompts, les reponses, et les documents traites restent integralement sur votre serveur. Cela repond aux exigences RGPD de minimisation des transferts de donnees personnelles et aux obligations de souverainete pour les donnees sensibles. Assurez-vous simplement de securiser l'acces au serveur (authentification, chiffrement TLS interne, journalisation des acces) et de documenter le traitement dans votre registre RGPD. Un deploiement local bien configure est plus conforme que n'importe quelle API cloud americaine.

Besoin d'aide pour deployer l'IA dans votre PME ?

Architecture sur mesure, choix du modele adapte a vos cas d'usage, installation et securisation, formation de vos equipes — nous accompagnons les PME francaises dans leur deploiement IA open source.

Obtenir mon devis gratuit

Articles lies :

Sources : GitHub — ollama/ollama, GitHub — vllm-project/vllm, GitHub — ggerganov/llama.cpp, GitHub — open-webui/open-webui