AI Models Flunk Engineering Simulation Test in Massive New Benchmark
A new 200,000-question benchmark from Carnegie Mellon University reveals that leading vision-language models perform at random chance when interpreting engineering ...
A new 200,000-question benchmark from Carnegie Mellon University reveals that leading vision-language models perform at random chance when interpreting engineering ...
© 2025 Scienmag - Science Magazine
© 2025 Scienmag - Science Magazine