Schémas de configuration de production OpenClaw avec plugins et compétences
« Comment les systèmes OpenClaw réels sont réellement structurés »
OpenClaw semble simple dans les démos. En production, il devient un système.
« Comment les systèmes OpenClaw réels sont réellement structurés »
OpenClaw semble simple dans les démos. En production, il devient un système.
Les abonnements à Claude n'alimentent plus les agents
La faille discrète qui a alimenté une vague d’expérimentation d’agents est désormais close.
Recherche IA auto-hébergée avec des LLM locaux
Vane est l’une des entrées les plus pragmatiques dans le domaine de la « recherche IA avec citations » : un moteur de réponse auto-hébergé qui combine la récupération web en direct avec des LLM locaux ou cloud, tout en gardant toute la pile sous votre contrôle.
Le codage agentique, désormais avec des backends de modèles locaux.
Claude Code n’est pas un simple autocomplétion avec un meilleur marketing. C’est un outil de codage agentique : il lit votre base de code, modifie des fichiers, exécute des commandes et s’intègre à vos outils de développement.
Installation et prise en main rapide de l’agent Hermes pour les développeurs
Hermes Agent est un assistant IA hébergé en propre (self-hosted), indépendant du modèle, qui s’exécute sur une machine locale ou un VPS à faible coût, fonctionne via des interfaces en terminal et de messagerie, et s’améliore avec le temps en transformant les tâches répétitives en compétences réutilisables.
Installez TGI, déployez rapidement, déboguez encore plus vite.
Text Generation Inference (TGI) possède une énergie très particulière. Ce n’est pas le nouveau venu de la rue de l’inférence, mais c’est celui qui a déjà appris comment la production peut se briser -
Vitesse de génération des tokens de llama.cpp sur 16 Go de VRAM (tableaux).
Ici je compare la vitesse de plusieurs LLM tournant sur un GPU avec 16 Go de VRAM, et je choisis le meilleur pour l’auto-hébergement.
La RTX 5090 est rare et surcotée en Australie.
L’Australie dispose de stock pour la RTX 5090. À peine. Et si vous en trouvez une, vous paierez une prime qui semble déconnectée de la réalité.
Accès distant à Ollama sans ports publics
Ollama est à son meilleur lorsque l’on le traite comme un démon local : la CLI et vos applications communiquent avec une API HTTP en boucle locale (loopback), et le reste du réseau ignore son existence.
Serveur Ollama orienté composition, avec GPU et persistance.
Ollama fonctionne parfaitement sur du matériel nu. Cela devient encore plus intéressant lorsque vous le traitez comme un service : une extrémité stable, des versions figées, un stockage persistant et une GPU qui est soit disponible, soit non.
HTTPS Ollama sans interrompre les réponses en flux.
Exécuter Ollama derrière un proxy inversé est le moyen le plus simple d’obtenir HTTPS, un contrôle d’accès facultatif et un comportement de streaming prévisible.
Intégration RAG - Python, Ollama, API OpenAI.
Si vous travaillez sur la génération augmentée par récupération (RAG), cette section explique les incorporations de texte (text embeddings) en termes simples : ce qu’elles sont, comment elles s’intègrent dans la recherche et la récupération, et comment appeler deux configurations locales courantes depuis Python en utilisant Ollama ou une API HTTP compatible OpenAI (comme le font de nombreux serveurs basés sur llama.cpp).
Faites fonctionner rapidement les modèles ouverts avec SGLang.
SGLang est un framework de service haute performance pour les grands modèles de langage et les modèles multimodaux, conçu pour fournir une inférence à faible latence et à haut débit sur tout, d’une seule GPU à des clusters distribués.
Échange à chaud de LLM locaux sans modifier les clients.
Bientôt, vous jonglerez avec vLLM, llama.cpp et plus encore — chaque pile sur son propre port. Tout ce qui se trouve en aval souhaite toujours une URL de base /v1; sinon, vous continuez à changer de ports, de profils et de scripts ponctuels. llama-swap est le proxy /v1 avant ces piles.
La plupart des configurations locales d’IA commencent par un modèle et un runtime.
Que se passe-t-il réellement lorsque vous lancez Ultrawork.
Oh My Opencode promet une « équipe de développement IA virtuelle » : Sisyphus orchestre des spécialistes, les tâches s’exécutent en parallèle et le mot magique ultrawork active tout cela.