Claude, OpenClaw et la fin du prix unique pour les agents
Les abonnements à Claude n'alimentent plus les agents
La faille discrète qui a alimenté une vague d’expérimentation d’agents est désormais close.
Les abonnements à Claude n'alimentent plus les agents
La faille discrète qui a alimenté une vague d’expérimentation d’agents est désormais close.
Recherche IA auto-hébergée avec des LLM locaux
Vane est l’une des entrées les plus pragmatiques dans le domaine de la « recherche IA avec citations » : un moteur de réponse auto-hébergé qui combine la récupération web en direct avec des LLM locaux ou cloud, tout en gardant toute la pile sous votre contrôle.
Le codage agentique, désormais avec des backends de modèles locaux.
Claude Code n’est pas un simple autocomplétion avec un meilleur marketing. C’est un outil de codage agentique : il lit votre base de code, modifie des fichiers, exécute des commandes et s’intègre à vos outils de développement.
Installation et prise en main rapide de l’agent Hermes pour les développeurs
Hermes Agent est un assistant IA hébergé en propre (self-hosted), indépendant du modèle, qui s’exécute sur une machine locale ou un VPS à faible coût, fonctionne via des interfaces en terminal et de messagerie, et s’améliore avec le temps en transformant les tâches répétitives en compétences réutilisables.
Installez TGI, déployez rapidement, déboguez encore plus vite.
Text Generation Inference (TGI) possède une énergie très particulière. Ce n’est pas le nouveau venu de la rue de l’inférence, mais c’est celui qui a déjà appris comment la production peut se briser -
Vitesse de génération des tokens de llama.cpp sur 16 Go de VRAM (tableaux).
Ici je compare la vitesse de plusieurs LLM tournant sur un GPU avec 16 Go de VRAM, et je choisis le meilleur pour l’auto-hébergement.
Serveur Ollama orienté composition, avec GPU et persistance.
Ollama fonctionne parfaitement sur du matériel nu. Cela devient encore plus intéressant lorsque vous le traitez comme un service : une extrémité stable, des versions figées, un stockage persistant et une GPU qui est soit disponible, soit non.
HTTPS Ollama sans interrompre les réponses en flux.
Exécuter Ollama derrière un proxy inversé est le moyen le plus simple d’obtenir HTTPS, un contrôle d’accès facultatif et un comportement de streaming prévisible.
Faites fonctionner rapidement les modèles ouverts avec SGLang.
SGLang est un framework de service haute performance pour les grands modèles de langage et les modèles multimodaux, conçu pour fournir une inférence à faible latence et à haut débit sur tout, d’une seule GPU à des clusters distribués.
Échange à chaud de LLM locaux sans modifier les clients.
Bientôt, vous jonglerez avec vLLM, llama.cpp et plus encore — chaque pile sur son propre port. Tout ce qui se trouve en aval souhaite toujours une URL de base /v1; sinon, vous continuez à changer de ports, de profils et de scripts ponctuels. llama-swap est le proxy /v1 avant ces piles.
La plupart des configurations locales d’IA commencent par un modèle et un runtime.
Que se passe-t-il réellement lorsque vous lancez Ultrawork.
Oh My Opencode promet une « équipe de développement IA virtuelle » : Sisyphus orchestre des spécialistes, les tâches s’exécutent en parallèle et le mot magique ultrawork active tout cela.
Faites la connaissance de Sisyphus et de son équipe d'agents spécialisés.
Le saut de capacité le plus important dans OpenCode provient des agents spécialisés : séparation délibérée de l’orchestration, de la planification, de l’exécution et de la recherche.
Installez Oh My Opencode et publiez plus rapidement.
Oh My Opencode transforme OpenCode en un harnais de codage multi-agents : un orchestrateur délègue le travail à des agents spécialisés qui s’exécutent en parallèle.
Test LLM OpenCode — statistiques de codage et de précision
J’ai testé comment OpenCode fonctionne avec plusieurs LLM hébergés localement sur Ollama et llama.cpp, et j’ai ajouté pour comparaison quelques modèles gratuits provenant d’OpenCode Zen.
Démarrage rapide d'OpenHands CLI en quelques minutes
OpenHands est une plateforme open-source et agnostique des modèles pour les agents de développement logiciel pilotés par l’IA. Il permet à un agent de se comporter davantage comme un partenaire de codage que comme un simple outil de complétion automatique.