Benchmark Reveals LLMs Fail One in Three Research Integrity Decisions
IntegrityBench evaluates how large language models handle research integrity under pressure, finding significant failure rates and inconsistent behavior across 18 frontier models.
research