Passer au contenu principal

Local et privé

Qu’est-ce que l’IA locale ?

L’IA locale fait tourner un modèle sur du matériel que vous contrôlez. Ce que cela change pour la confidentialité et le coût, et où elle rivalise vraiment.

Toutes les explications · Dernière vérification:

Ce que cela change

Les données sont la vraie raison. Un prompt envoyé à un modèle hébergé est traité par ce fournisseur selon ses conditions. Un prompt à un modèle local n’est envoyé nulle part, seule version de cette garantie qui ne dépende pas de la politique d’un tiers.

Cela supprime aussi la facturation au token, les limites de débit et la possibilité qu’un modèle soit retiré sous vos pieds. Un modèle téléchargé continue de fonctionner.

La forme du coût, pas le coût

L’IA locale n’est pas automatiquement moins chère. Elle transforme un coût variable en coût fixe : vous achetez ou louez du matériel, puis l’inférence est quasi gratuite à la marge.

C’est un bon calcul à volume élevé et régulier, un mauvais pour un usage occasionnel. Un GPU inactif la plupart de la journée coûte plus cher que les appels d’API qu’il remplace.

Les limites honnêtes

Les modèles qui tournent confortablement sur une seule machine ne sont en général pas les plus gros disponibles. Sur les tâches de raisonnement les plus dures, l’écart avec un modèle de pointe hébergé est réel.

Pour énormément de tâches quotidiennes — résumer, rédiger, extraire, classer, coder de la routine — l’écart est bien plus faible qu’on ne le croit, et les propriétés de confidentialité et de coût pèsent souvent plus que le dernier incrément de capacité.

Surtout utile en hybride

Le schéma courant n’est ni tout local ni tout cloud. C’est local pour ce qui est sensible ou volumineux, hébergé pour les questions les plus dures, et une politique qui décide de la répartition — précisément le rôle d’un routeur.

Questions fréquentes

Quel matériel me faut-il ?
Cela dépend entièrement de la taille du modèle et de la quantisation, et quiconque vous donne un chiffre unique devine. La contrainte dominante est la mémoire disponible : les poids doivent tenir, et ce qui tient détermine ce que vous pouvez exécuter.
L’IA locale est-elle privée par définition ?
L’appel au modèle l’est. Le reste de l’application peut ne pas l’être — recherche, télémétrie et autres intégrations peuvent encore sortir. La confidentialité est une propriété du système entier, pas d’un composant.
Les modèles locaux peuvent-ils utiliser mes documents ?
Oui. La récupération fonctionne pareil, et quand la récupération et le modèle sont locaux, les documents ne quittent votre matériel à aucun moment.

Essayez plutôt que de lire

ClawAI exécute les modèles locaux via Ollama et llama.cpp, et son mode de routage local seul garde toute la chaîne de repli chez des fournisseurs locaux au lieu d’aller chercher un modèle cloud.