// l0g agent bench

Mesurer ce que l’agent trouve vraiment.

Ce benchmark exécute 44 questions déterministes en français et en anglais contre le serveur MCP publié. Aucun LLM n’est appelé : les tests vérifient les documents dans le top 3, les sources primaires, la parité des traductions, le comportement asOf, le refus des requêtes non étayées, la fraîcheur et la séparation observation, inférence, estimation et scénario.

scorechargement…
versions
méthodedéterministe · 0 LLM

Résultats par capacité

Contrat de preuve

Le score, le hash du jeu de cas, les versions testées et chaque résultat sont publiés dans un artefact JSON attesté par le workflow de build.

Lire le résultat JSON →