Neue Benchmark prüft, ob Sprachmodelle nicht nur korrekte Antworten geben, sondern exakt die Textstelle nennen.In KürzeCiteVQA testet 1.897 Fragen in 711 PDFs und verlangt exakte Belegstellen.Spitzenmodelle schneiden bei Quellenangaben deutlich schlechter ab als bei reiner...




