// l0g agent bench
Mesurer ce que l’agent trouve vraiment.
Ce benchmark exécute 44 questions déterministes en français et en anglais contre le serveur MCP publié. Aucun LLM n’est appelé : les tests vérifient les documents dans le top 3, les sources primaires, la parité des traductions, le comportement asOf, le refus des requêtes non étayées, la fraîcheur et la séparation observation, inférence, estimation et scénario.
scorechargement…
versions—
méthodedéterministe · 0 LLM
Résultats par capacité
Contrat de preuve
Le score, le hash du jeu de cas, les versions testées et chaque résultat sont publiés dans un artefact JSON attesté par le workflow de build.