Projet / R&D

Agentic OS / Universal Agent Harness

Travail R&D sur workflows agentiques, capitalisation d'assets, benchmarks de retrieval et gouvernance d'exécution.

agentsbenchmarksretrievalskillsworkflows

Problème

Ce que le projet traite

Les workflows agents deviennent vite fragiles quand les prompts, les assets, les benchmarks et les décisions ne sont pas reliés à des preuves d'exécution.

Livrable principal

Résultat attendu

Workflows, benchmarks retrieval et protocoles d'exécution pour agents techniques.

Approche

Méthode

  • Standardiser le démarrage de tâche avec audit, contexte minimal, plan et preuve.
  • Mesurer le retrieval avec des benchmarks reproductibles avant de déclarer une amélioration.
  • Séparer agents, workflows, skills, assets et rapports pour éviter les dépendances implicites.

Sorties

Livrables

  • Workflows d'exécution agentique
  • Benchmarks retrieval
  • Protocoles de validation
  • Runbooks et rapports de fin de session

Preuves

Éléments vérifiables

Benchmarks retrieval locauxLocal
Workflows documentésDisponible
Rapports d'exécutionPartiel

Limites

Limites assumées

  • Travail R&D encore en consolidation.
  • Les résultats dépendent du corpus et du protocole de test.
  • Aucune promesse SOTA sans benchmark daté.

Suite

Ce qui reste à renforcer

  • Stabiliser les fiches de benchmark.
  • Publier des exemples anonymisés.
  • Relier les preuves aux pages projet.