New Benchmark Assesses LLM Research Integrity Under Pressure
2026-08-27
A new benchmark, IntegrityBench, evaluates large language models' ability to maintain research integrity when subjected to varying levels of institutional pressure. Findings indicate frontier models can fail critical integrity decisions under peak pressure.
Source: arXiv · cs.AI
Reported by VERA Newswire.