Projet / R&D
Agentic OS / Universal Agent Harness
Travail R&D sur workflows agentiques, capitalisation d'assets, benchmarks de retrieval et gouvernance d'exécution.
Problème
Ce que le projet traite
Les workflows agents deviennent vite fragiles quand les prompts, les assets, les benchmarks et les décisions ne sont pas reliés à des preuves d'exécution.
Livrable principal
Résultat attendu
Workflows, benchmarks retrieval et protocoles d'exécution pour agents techniques.
Approche
Méthode
- Standardiser le démarrage de tâche avec audit, contexte minimal, plan et preuve.
- Mesurer le retrieval avec des benchmarks reproductibles avant de déclarer une amélioration.
- Séparer agents, workflows, skills, assets et rapports pour éviter les dépendances implicites.
Sorties
Livrables
- Workflows d'exécution agentique
- Benchmarks retrieval
- Protocoles de validation
- Runbooks et rapports de fin de session
Preuves
Éléments vérifiables
Benchmarks retrieval locauxLocal
Workflows documentésDisponible
Rapports d'exécutionPartiel
Limites
Limites assumées
- Travail R&D encore en consolidation.
- Les résultats dépendent du corpus et du protocole de test.
- Aucune promesse SOTA sans benchmark daté.
Suite
Ce qui reste à renforcer
- Stabiliser les fiches de benchmark.
- Publier des exemples anonymisés.
- Relier les preuves aux pages projet.