Agent Evaluation Benchmark
Ein confidence-aware Evaluationsrahmen fuer openclaw-aehnliche persoenliche Assistenten, der mehr misst als Demo-Performance.
Statistical Confidence, Judge Agreement, Coverage und Cross-run Stability angewendet; ein separater Ausbau ergaenzte 40 RPA-, IM-, Cross-system- und Email-Tasks.