Retour au blogIntelligence artificielle

Rapid-MLX : montez un serveur IA local sur votre Mac en quelques minutes

CZSyn
27 juillet 2026
6 min

Rapid-MLX installe un serveur d'inférence compatible OpenAI et Anthropic sur Mac Apple Silicon : choix du modèle, test local, branchement Claude Code.

Un MacBook Apple Silicon ouvert la nuit sur un terminal affichant un serveur d'inférence IA local, bureau sombre et épuré
Ce qu'il faut retenir.
  1. Rapid-MLX est un moteur d'inférence local pour Mac Apple Silicon qui émule les API d'OpenAI et d'Anthropic, ce qui permet à Cursor, Aider, LangChain et Claude Code de fonctionner sans passer par un datacenter externe.
  2. L'installation demande macOS 14 Sonoma au minimum et une puce Apple Silicon ; le modèle à choisir dépend directement de la RAM disponible, de qwen3.5-4b-4bit pour 8 à 23 Go jusqu'à gpt-oss-120b-mxfp4-q8 pour 96 Go et plus.
  3. Les trois pannes les plus fréquentes sont un raisonnement activé par défaut qui ralentit le mode serveur (réglé par --no-think), un modèle trop gros pour la RAM disponible, et des appels d'outils reçus en texte brut nécessitant parfois un parser dédié.

Résumé généré par IA

Le 27 juillet 2026, Rapid-MLX confirme une tendance de fond chez les développeurs équipés d'un Mac Apple Silicon : l'envie de faire tourner un modèle de langage en local, sans facture au token et sans qu'un seul prompt ne quitte la machine. Cet outil open source, maintenu par Raullen Chai, s'installe en une poignée de commandes et transforme un Mac en serveur d'inférence compatible avec les API d'OpenAI et d'Anthropic.

Voyons comment l'installer sans se planter sur le choix du modèle, l'erreur la plus fréquente des premiers essais.

Qu'est-ce que Rapid-MLX au juste ?

Rapid-MLX est un fork de vLLM-MLX, le serveur d'inférence développé par Wayner Barrios, dont il reprend la base avec un rythme de mises à jour plus soutenu. Il s'appuie directement sur les kernels MLX d'Apple, la bibliothèque de calcul optimisée pour les puces M, sans passer par llama.cpp ni par une couche Metal intermédiaire. Résultat : un serveur HTTP qui parle le même langage que l'API d'OpenAI et celle d'Anthropic. Vos scripts, Cursor, Aider, LangChain ou Claude Code continuent de fonctionner normalement, sauf qu'ils envoient leurs requêtes vers votre propre machine au lieu d'un datacenter distant.

Étape 0 : vérifier que votre Mac est éligible

Rapid-MLX ne tourne que sur puce Apple Silicon, sans version Linux ni Windows, et sans support CUDA ou AMD. Le script d'installation accepte encore macOS 13 Ventura, mais le vrai plancher est macOS 14 Sonoma : la formule Homebrew l'exige, et MLX, la brique Apple sur laquelle tout repose, ne publie de paquets que pour les versions 14, 15 et 26 de macOS. Sur une machine restée en Ventura, l'installation des dépendances échouera donc.

Autre point à connaître : Rapid-MLX est pensé pour un usage personnel. Vous n'y trouverez ni authentification multi-utilisateurs, ni quotas de requêtes, ce n'est donc pas un outil à exposer tel quel sur un réseau partagé ou mutualisé sans couche de sécurité additionnelle.

Étape 1 : installer Rapid-MLX

L'installation la plus simple passe par Homebrew :

brew install rapid-mlx

Si vous gérez déjà vos environnements Python vous-même, deux autres chemins existent :

uv tool install rapid-mlx@latest
python3.12 -m pip install rapid-mlx

Un installeur en une ligne existe également (curl -fsSL https://rapidmlx.com/install.sh | bash) : il détecte la RAM disponible, propose un modèle adapté, crée un environnement virtuel isolé dans ~/.rapid-mlx/ et installe le binaire dans ~/.local/bin/. La formule Homebrew fait le même travail sans les précautions habituelles d'un curl vers bash, elle reste notre recommandation par défaut.

L'installation de base pèse environ 460 Mo. La vision, l'audio et les embeddings sont des extras optionnels, à ajouter seulement si vous en avez l'usage.

Étape 2 : choisir un modèle qui tient dans votre RAM

C'est l'étape où la plupart des essais tournent court : charger un modèle trop gros pour la machine, puis conclure que l'outil est lent. Sur Mac, la mémoire est unifiée, le modèle partage donc directement la RAM entre le CPU et le GPU. Les paliers recommandés par le projet :

  • 8 à 23 Go de RAM : qwen3.5-4b-4bit
  • 24 à 47 Go de RAM : gpt-oss-20b-mxfp4-q8
  • 48 à 95 Go de RAM : qwen3.6-35b-8bit
  • 96 Go de RAM et plus : gpt-oss-120b-mxfp4-q8

Le catalogue complet se liste avec rapid-mlx models, et rapid-mlx info <alias> donne le profil détaillé d'un modèle précis. Pour télécharger les poids à l'avance :

rapid-mlx pull qwen3.5-9b-4bit

Le modèle atterrit dans le cache Hugging Face de la machine. Ce téléchargement préalable reste facultatif puisque chat et serve récupèrent automatiquement ce qui manque, mais il évite de patienter au moment où vous voulez travailler.

Étape 3 : tester, puis lancer le serveur

Avant toute intégration, un test en direct s'impose :

rapid-mlx chat

La commande démarre par défaut sur qwen3.5-4b-4bit, télécharge les poids au premier lancement (comptez 2,5 Go) et ouvre une interface en ligne de commande. Le raisonnement du modèle y est coupé par défaut pour éviter d'afficher toute sa réflexion à l'écran. En mode serveur, c'est l'inverse, et cela change nettement la vitesse ressentie.

Le vrai intérêt de Rapid-MLX se joue en mode serveur :

rapid-mlx serve qwen3.5-4b-4bit

Vous obtenez un endpoint sur http://localhost:8000. Côté Python, le SDK OpenAI reste inchangé, seule l'URL de base change :

from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="not-needed")
print(client.chat.completions.create(
    model="default",
    messages=[{"role": "user", "content": "Say hello"}],
).choices[0].message.content)

N'importe quel client compatible OpenAI (Cursor, Aider, LibreChat, Open WebUI, LangChain) fonctionne avec ce seul changement d'URL. Deux routes supplémentaires méritent d'être connues : /v1/embeddings pour du RAG local, et /v1/responses pour Codex CLI.

Brancher Claude Code sur votre propre Mac

Brancher Claude Code sur votre Mac plutôt que sur l'API Anthropic distante tient en deux variables d'environnement, une fois le serveur lancé :

ANTHROPIC_BASE_URL=http://localhost:8000 ANTHROPIC_API_KEY=not-needed claude

Attention à un détail qui piège facilement : l'URL de base doit pointer vers la racine, sans le suffixe /v1. Le SDK Anthropic ajoute lui-même /v1/messages, l'ajouter manuellement casse donc l'appel. Depuis la version 0.10.14 de Rapid-MLX, l'appel d'outils passe par une grammaire contrainte activée par défaut : plus besoin de configurer manuellement un --tool-call-parser. Pour un usage sérieux de Claude Code en local, la documentation du projet recommande un modèle plus consistant, comme qwen3.6-35b-4bit, plutôt que le modèle prévu pour un simple test.

Quand ça coince

Le premier réflexe en cas de souci est une commande de diagnostic intégrée à l'outil :

rapid-mlx doctor

Trois pannes reviennent le plus souvent : un débit décevant en mode serveur, dû au raisonnement activé par défaut sur certains modèles, que l'option --no-think règle ; un plantage mémoire, qui signale un modèle trop gros pour la RAM disponible, il faut alors redescendre d'un palier ou choisir une quantification plus agressive ; et des appels d'outils reçus en texte brut, généralement corrigés automatiquement, sinon il reste possible de forcer le parser correspondant au modèle utilisé.

Notre lecture chez CZSyn

Nous voyons deux catégories de clients concernées par ce type d'outil. D'un côté, les développeurs et petites équipes qui itèrent beaucoup avec un assistant de code et qui voient leur facture API grimper au fil des mois : faire tourner un modèle local pour le gros du volume, et ne réserver l'API cloud qu'aux tâches qui demandent vraiment un modèle de pointe, change concrètement l'équation économique. De l'autre, les PME qui manipulent des données sensibles (code propriétaire, documents clients, contrats), pour qui le simple fait qu'un prompt ne quitte jamais le poste de travail lève une bonne partie des questions de conformité qu'on nous pose en audit.

Le point de vigilance, et il est de taille : Rapid-MLX n'a ni authentification ni gestion de quotas. C'est un outil pour un poste de travail individuel, pas une brique à exposer sur un réseau d'entreprise sans couche de sécurité additionnelle. Le choix du modèle reste aussi une contrainte matérielle réelle : un Mac avec peu de RAM se contentera d'un petit modèle généraliste, loin des capacités d'un modèle propriétaire de dernière génération sur des tâches complexes. Pour du dépannage ponctuel, de la complétion, du RAG local ou des tests hors ligne, la proposition est en revanche très solide, d'autant que l'intégration native avec Claude Code et les clients compatibles OpenAI limite le travail de câblage à une poignée de variables d'environnement.

Vous hésitez entre IA locale et IA cloud pour votre entreprise ?

Nous auditons vos besoins réels et vous accompagnons dans le choix, le développement sur-mesure et le dépannage de vos outils IA. Audit gratuit sous 24h.

06 64 81 45 03

ou programmez votre appel · devis gratuit en ligne

29 avis 5/5 · +200 projets livrés · réponse express

Sources primaires

  • Site officiel Rapid-MLX, rapidmlx.com.
  • Dépôt officiel MLX, la bibliothèque de calcul d'Apple pour Apple Silicon.
  • Documentation officielle Claude Code, Anthropic.

Un projet en tête ?

Diagnostic gratuit, devis ferme, et un seul interlocuteur du premier appel à la mise en ligne.