
Ollama v0.35.1 : Quand l'Inférence Locale Devient Stratégique pour nos Agents Décisionnels
Les dernières 48 heures ont été riches en annonces pour l'écosystème de l'IA locale. Ollama, notre framework de prédilection pour l'exécution de LLMs open source, vient de déployer ses versions v0.35.0 et v0.35.1, apportant des innovations majeures pour les agents autonomes et l'optimisation des performances. Ces mises à jour redéfinissent clairement les capacités d'inférence sur nos infrastructures privées.
Ollama v0.35.1 : Un Saut Quantique pour l'Agentique Locale
Chez Astoïk, nous suivons de près chaque évolution des solutions d'inférence locale. C'est un pilier de notre approche pour offrir à nos clients une souveraineté des données et une maîtrise des coûts. Les versions v0.35.0 et v0.35.1 d'Ollama, déployées coup sur coup ces derniers jours, ne sont pas de simples mises à jour incrémentales. Elles marquent un véritable tournant, en particulier avec l'introduction des modèles de décision et l'intégration de capacités de recherche web natives. C'est le genre de développement qui change la donne pour nos architectures d'agents autonomes en entreprise.
Historiquement, l'exécution locale de grands modèles de langage a toujours été synonyme de compromis : performance brute contre accessibilité, ou modèles de petite taille contre capacités limitées. Ollama a déjà cassé une partie de ces barrières, mais ce que nous voyons émerger maintenant, c'est une sophistication accrue, directement utilisable sur nos GPU. La capacité de faire tourner des modèles puissants, comme Qwen ou DeepSeek, directement sur nos serveurs ou même sur des postes de travail équipés d'Apple Silicon, ouvre des perspectives inédites pour le développement d'applications IA métiers.
Les Modèles de Décision : Une Nouvelle Ère pour l'Orchestration d'Agents
Le point le plus frappant de cette série de mises à jour est sans aucun doute l'intégration des modèles de décision via la nouvelle API `/v1/systemone` dans Ollama v0.35.0. Fini les retours textuels bruts qu'il fallait ensuite parser et interpréter. Désormais, nous pouvons obtenir des choix structurés, des probabilités associées et des scores précis. C'est une révolution pour quiconque construit des systèmes d'agents complexes.
Concrètement, cela signifie que nos agents peuvent désormais prendre des décisions binaires ('oui/non'), choisir parmi une liste d'options prédéfinies ou même attribuer des scores à différentes possibilités, le tout avec une probabilité associée à chaque option. Imaginez les scénarios : un agent de triage de tickets qui classe automatiquement les requêtes avec un niveau de confiance, un système de routage de modèles qui sélectionne le LLM le plus adapté à une tâche en fonction de critères de performance et de coût, ou encore une solution de classification de contenu qui attribue des tags avec une précision quantifiable. La latence est faible et le coût nul pour ces opérations, car elles sont exécutées localement. C'est un avantage concurrentiel indéniable pour nos clients.
Nous avons déjà commencé à expérimenter avec ces modèles de décision sur nos déploiements. Ce qu'on observe, c'est une réduction drastique de la complexité du post-traitement des réponses. Au lieu de s'appuyer sur des expressions régulières ou des chaînes de prompt délicates pour extraire une décision, le modèle renvoie directement un objet structuré. Cela rend les agents beaucoup plus robustes et moins sujets aux hallucinations ou aux erreurs d'interprétation. C'est un gain de temps considérable pour nos équipes d'ingénieurs.

L'Agent Autonome Connecté : Recherche Web Intégrée avec v0.35.1
La version v0.35.1 d'Ollama va encore plus loin en introduisant la prise en charge de jusqu'à dix recherches web par réponse. C'est une fonctionnalité clé pour les agents autonomes qui ont besoin d'informations à jour et contextuelles. Jusqu'à présent, l'intégration de la recherche web nécessitait des outils externes, des API dédiées et une logique d'orchestration complexe. Ollama simplifie grandement cette tâche.
Cette capacité de recherche intégrée enrichit considérablement le potentiel de nos agents RAG (Retrieval Augmented Generation). Au lieu de se limiter à une base de connaissances statique ou pré-indexée, un agent peut désormais effectuer des requêtes dynamiques sur le web pour compléter ses réponses, vérifier des faits ou explorer des sujets connexes en temps réel. C'est essentiel pour les tâches nécessitant une information très récente ou une exploration contextuelle approfondie. On pense notamment aux agents de veille stratégique, aux assistants de recherche juridique ou aux systèmes de support client qui doivent accéder aux dernières documentations produits.
Sur le terrain, nous constatons que cette fonctionnalité réduit la dépendance à des boucles d'agents externes pour la recherche d'informations. L'agent peut gérer une partie de son besoin en information directement via Ollama, ce qui simplifie l'architecture globale et réduit la latence des interactions. C'est un pas de géant vers des agents véritablement autonomes et informés, capable de naviguer dans le monde réel de l'information.
Optimisations Ciblées : Qwen, Apple Silicon et Mémoire VRAM
Au-delà des nouvelles fonctionnalités, Ollama continue d'affiner son moteur. Les versions récentes apportent des améliorations notables en matière de gestion de la mémoire MLX sur Apple Silicon et une accélération du traitement des prompts pour Qwen 3.8. Pour nous, qui déployons des solutions sur une variété d'infrastructures, y compris des machines Apple Silicon pour le développement et certains cas d'usage Edge, ces optimisations sont cruciales.
Les modèles de la famille Qwen, notamment la synergie entre Qwen3.8-Omni-Flash et Ollama, sont devenus des acteurs majeurs de l'inférence locale grâce à leurs performances et leur flexibilité. Le fait qu'Ollama optimise spécifiquement le traitement des prompts pour Qwen 3.8 sur Apple Silicon montre une attention aux détails qui se traduit directement par des gains de performance tangibles. Moins de latence, c'est une meilleure expérience utilisateur et une plus grande efficacité pour les boucles d'agents. Une meilleure gestion de la mémoire MLX signifie que nous pouvons faire tourner des modèles plus grands ou un plus grand nombre de modèles simultanément sur des machines avec une VRAM limitée, ce qui est un facteur de coût non négligeable.
Nous avons aussi noté des améliorations dans la gestion des bibliothèques de modèles volumineuses et la stabilité générale de l'application macOS. Ces détails techniques, souvent invisibles pour l'utilisateur final, sont essentiels pour les déploiements en production. La fiabilité et la vitesse de chargement des modèles ont un impact direct sur la disponibilité de nos services et la réactivité de nos agents. L'intégration avec ChatGPT Desktop pour l'exécution de modèles locaux est également une petite touche qui peut faciliter la vie de certains développeurs.
Implications pour les Architectures d'Agents en Entreprise

Ces avancées d'Ollama ne sont pas juste des prouesses techniques ; elles ont des implications profondes pour la manière dont nous concevons et déployons les architectures d'agents en entreprise. L'inférence locale, déjà attrayante pour la confidentialité et le contrôle des données, devient désormais compétitive en termes de capacités.
Un des défis majeurs dans l'orchestration multi-agents en entreprise est de minimiser les allers-retours vers des APIs cloud coûteuses et potentiellement lentes. En déportant des fonctions critiques comme la prise de décision structurée et la recherche d'informations sur le web directement au niveau de l'inférence locale via Ollama, nous réduisons significativement la dépendance aux services externes. Cela se traduit par des architectures plus résilientes, des coûts d'exécution prévisibles et une latence réduite, des aspects fondamentaux pour nos clients PME et grandes entreprises.
Nous pouvons désormais envisager des agents plus complexes, capables de raisonner, de prendre des décisions et de s'informer sans quitter l'environnement de nos serveurs. Cela ouvre la voie à des applications métiers où la confidentialité est primordiale, comme le traitement de données financières, médicales ou stratégiques. L'approche est double : d'un côté, nous avons des modèles comme DeepSeek-V4.1-Flash qui redéfinissent l'impact de DeepSeek-V4.1-Flash sur l'inférence locale avec une efficacité impressionnante, et de l'autre, Ollama qui fournit l'infrastructure logicielle pour les exploiter au maximum de leur potentiel.
Défis et Perspectives : L'Équilibre entre Puissance et Ressources
Malgré ces avancées, des défis subsistent. L'exécution de modèles de plus en plus grands nécessite toujours des ressources matérielles significatives. La mémoire VRAM reste un goulot d'étranglement pour de nombreux déploiements. Bien qu'Ollama optimise l'utilisation des GPU, il faut une planification minutieuse pour s'assurer que l'infrastructure est à la hauteur des ambitions de nos agents.
La gestion des dépendances et la compatibilité des modèles avec Ollama évoluent rapidement. Nous devons rester vigilants et tester continuellement les nouvelles versions pour nous assurer de la stabilité de nos pipelines. Le choix entre un modèle open source local et une API cloud reste une décision stratégique, influencée par des facteurs comme le volume de requêtes, la sensibilité des données, la latence critique et, bien sûr, le budget.
Pour l'avenir, nous nous attendons à voir Ollama continuer sur cette lancée, en intégrant toujours plus de capacités agentiques et en optimisant davantage l'inférence locale. L'émergence de modèles multimodaux et de capacités de raisonnement améliorées directement sur nos machines est une tendance forte que nous anticipons. Cela va sans doute démocratiser encore plus l'accès à l'IA de pointe pour les entreprises qui ne souhaitent ou ne peuvent pas dépendre entièrement du cloud.
Ces dernières mises à jour d'Ollama consolident notre conviction que l'inférence locale, couplée à des architectures d'agents bien conçues, est la clé d'une IA d'entreprise plus agile, plus sécurisée et plus rentable. C'est une voie que nous explorons activement chez Astoïk, pour permettre à nos clients de tirer pleinement parti de ces technologies.
Besoin d'avancer sur ce sujet ?
Discutons de vos enjeux spécifiques lors d'un audit informel.

Lou Chardin
Head of Product
Conçoit les architectures de données et les OS métiers IA d'Astoïk. Passionné par l'intégration pratique de l'IA générative.
Profil LinkedIn