Fictional demonstration · WorkflowSelect Tested

Relay Agent

69.6
Benchmark v0.1Product Fictional Demo 1.0Tested 8/18/202610 scenarios10 executions

Component scores

task success
60%
factual accuracy
60%
hallucination safety
90%
escalation accuracy
90%
latency
64%
cost efficiency
77%
Methodology

Ten deterministic synthetic business-task scenarios covering booking, information accuracy, safe refusal, and escalation. Demonstration results do not represent real vendors.

Evidence status: execution inputs, outputs, evaluator versions and scoring version are retained.