
Ollama v0.35.1 et les Modèles de Décision Clef : La Nouvelle Ère des Agents Locaux Intelligents
La dernière mise à jour d'Ollama, la v0.35.1, intègre les modèles de décision Clef de Cloudflare. C'est un pivot pour l'inférence locale. Nous explorons comment ces modèles transforment l'architecture de nos agents autonomes, offrant une agilité et une maîtrise des coûts inédites pour nos déploiements en entreprise.
Le monde de l'IA bouge vite. Vraiment vite. On le dit souvent, mais cette semaine, on a eu une confirmation éclatante avec la sortie d'Ollama v0.35.1. Ce n'est pas une simple mise à jour incrémentale. Non, cette version intègre ni plus ni moins les modèles de décision Clef et Clef Flash de Cloudflare via l'API /v1/systemone. Pour nous, chez Astoïk, c'est un game changer pour l'inférence locale et l'architecture de nos agents autonomes. On parle ici de décisions rapides, multimodales et à coût zéro, directement sur nos machines. Le constat est net.
Pourquoi Clef et Ollama, c'est le mariage de l'année pour l'agentique locale
Jusqu'à présent, orchestrer des agents locaux avec des capacités de décision complexes, c'était jongler. On devait soit s'appuyer sur des LLM génériques, coûteux en inférence et pas toujours optimisés pour des choix binaires ou catégoriels, soit coder des règles métier rigides. Les modèles de décision Clef de Cloudflare, avec leurs 27 milliards de paramètres pour Clef et 9 milliards pour Clef Flash, changent la donne. Ce sont des modèles multimodaux, capables d'analyser non seulement le texte, mais aussi des images, pour prendre une décision. Imaginez un agent qui scanne une capture d'écran et décide instantanément si elle contient le logo d'Ollama. C'est ça, la promesse.
Nous avons déjà beaucoup exploré les avantages d'Ollama pour l'exécution locale de modèles, notamment dans notre article sur Ollama v0.35.1 : Quand l'Inférence Locale Devient Stratégique pour nos Agents Décisionnels. L'intégration native de Clef via /v1/systemone est une évolution logique et puissante. Elle permet à nos agents de poser des questions structurées et d'obtenir des réponses probabilistes. Fini les interprétations hasardeuses des sorties de LLM pour des décisions critiques. On gagne en précision, en rapidité, et surtout, en maîtrise.
Au-delà des promesses : nos retours terrain sur Clef et Ollama

Sur nos premières implémentations, ce qu'on observe est très encourageant. La latence est infime. Pour des requêtes simples de classification ou de validation, les modèles Clef répondent quasiment instantanément. C'est essentiel pour les agents qui doivent opérer en temps réel, comme ceux qui surveillent des flux de données ou qui automatisent des interactions client. La capacité multimodale, bien que nous n'ayons pas encore eu le temps de la pousser à l'extrême sur des cas clients réels, montre un potentiel énorme pour des applications de triage visuel ou de vérification d'identité.
Le modèle Clef Flash, avec ses 9 milliards de paramètres, est particulièrement intéressant pour les déploiements sur des machines avec une VRAM limitée. On le fait tourner sans souci sur des cartes grand public, ce qui réduit drastiquement les coûts d'infrastructure. Pour nos clients PME, c'est un argument de poids. L'idée est de décharger les gros LLM, comme ceux que nous évoquions pour l'agentique d'entreprise dans l'article sur DeepSeek V5 : Le Modèle Qui Redéfinit l'Inférence Locale et l'Agentique d'Entreprise, ou l'Arlésienne de l'Open Source ?, des tâches décisionnelles pour leur laisser la place aux raisonnements complexes.
Les CAPABILITY declarations dans les Modelfiles : une avancée pour l'orchestration
Ollama v0.35.1 ne se limite pas aux modèles Clef. L'introduction des déclarations de CAPABILITY dans les Modelfiles est une brique architecturale majeure. Cela permet de spécifier les capacités requises par un modèle, et par extension, par un agent. On peut désormais déclarer qu'un modèle nécessite une capacité de décision avant de planifier des requêtes System One. C'est une manière élégante de gérer les dépendances et d'optimiser l'orchestration des agents. Fini les agents qui tentent d'utiliser des outils qu'ils ne possèdent pas ou de lancer des tâches inappropriées. La robustesse de nos architectures multi-agents s'en trouve grandement améliorée.
FROM clef-flash
LICENSE Apache 2.0
PARAMETER temperature 0.1
CAPABILITY decision
SYSTEM "You are a highly efficient decision-making agent. Analyze the input and provide a concise JSON response based on the defined questions."Ce Modelfile simple illustre comment nous pouvons désormais déclarer une capacité de décision. En pratique, cela signifie que notre orchestrateur d'agents peut vérifier cette capacité avant d'allouer une tâche à un modèle spécifique. C'est une optimisation de la chaîne de valeur, un gain d'efficacité non négligeable sur des déploiements à grande échelle. On pense notamment aux architectures que nous mettons en place pour nos clients, où chaque milliseconde compte et où la consommation de ressources doit être finement contrôlée.
Impact sur la souveraineté et les coûts d'inférence
L'un des leviers fondamentaux de notre approche chez Astoïk est la maîtrise. Maîtrise des données, maîtrise des coûts, maîtrise technologique. L'intégration de Clef dans Ollama renforce cette vision. En exécutant des modèles de décision localement, nous réduisons notre dépendance aux APIs tierces, souvent hébergées à l'étranger. C'est un pas de plus vers la souveraineté numérique, un sujet qui nous tient à cœur et que nous abordons régulièrement avec nos partenaires européens.

Sur le plan économique, c'est une opportunité de taille. Les modèles de décision, par leur nature optimisée pour des tâches spécifiques, sont beaucoup moins gourmands en ressources que des LLM généralistes. Cela se traduit par une consommation de tokens quasi nulle pour l'API Clef via Ollama, ce qui rend l'exécution de millions de décisions par jour pratiquement gratuite. C'est un contraste frappant avec les coûts d'API que nous avons pu observer sur des déploiements plus anciens, où chaque décision, même simple, générait une facture salée. L'article Qwen3.8-Omni-Flash et Ollama : La Synergie Qui Redéfinit l'Agentique Locale montrait déjà l'importance de cette optimisation des coûts.
Limites actuelles et perspectives d'évolution
Bien sûr, tout n'est pas parfait du premier coup. Les modèles Clef, étant des modèles de décision, sont par définition spécialisés. Ils excellent dans leur domaine, mais ne remplacent pas un LLM généraliste pour des tâches de génération de texte créative ou de raisonnement complexe. Il faut bien comprendre leur rôle : agir comme des "aiguilleurs" intelligents dans une architecture d'agents, et non comme des "cerveaux" complets. La multimodalité est encore en phase de découverte pour beaucoup de cas d'usage, et nous devons encore explorer les limites de ce qu'ils peuvent "voir" et "comprendre" à partir d'une image.
Un autre point, c'est la gestion des Modelfiles et des CAPABILITY declarations. Si l'idée est excellente, la standardisation et l'outillage autour de ces déclarations devront évoluer. Nous voyons déjà des cas où la complexité des Modelfiles peut devenir un frein si l'on ne met pas en place des pratiques de gestion de configuration rigoureuses. Mais c'est le prix à payer pour une flexibilité accrue et une meilleure granularité dans la gestion de nos modèles locaux.
Les prochaines étapes pour nous seront d'intégrer Clef plus profondément dans nos frameworks d'orchestration d'agents existants, comme CrewAI ou LangGraph. L'objectif est de créer des agents encore plus "conscients" de leurs propres capacités et de celles des modèles qu'ils utilisent. Cela ouvre la porte à des architectures auto-adaptatives, où les agents peuvent dynamiquement choisir le modèle le plus approprié pour chaque sous-tâche, en fonction de ses besoins spécifiques en termes de décision, de génération ou de multimodalité. C'est l'avenir de l'agentique d'entreprise, et nous sommes ravis d'y contribuer activement.
Cette mise à jour d'Ollama est un pas de géant. Elle nous donne des outils plus affûtés pour construire des systèmes d'IA plus efficaces, plus économiques et plus souverains. Le développement local continue de prouver sa valeur, et nous sommes convaincus que cette tendance ne fera que s'amplifier dans les mois à venir.
Besoin d'avancer sur ce sujet ?
Discutons de vos enjeux spécifiques lors d'un audit informel.

Lou Chardin
Head of Product
Conçoit les architectures de données et les OS métiers IA d'Astoïk. Passionné par l'intégration pratique de l'IA générative.
Profil LinkedIn