1 writing found
Consistency gaps in LLM agents are hiding in plain sight. Why average accuracy masks unreliability, and how to measure what users actually care about.