flâneur

Strategic Dishonesty Can Undermine AI Safety Evaluations of Frontier LLMs

arxiv.org · 6,084 words · saved by 1 readers

N/A

S TRATEGIC D ISHONESTY C AN U NDERMINE AI S AFETY E VALUATIONS OF F RONTIER LLM S Alexander Panfilov1,2* Evgenii Kortukov3* Kristina Nikolić4 Matthias Bethge2,5 Sebastian Lapuschkin3,6 Wojciech Samek3,7 Ameya Prabhu2,5 Maksym Andriushchenko1,2 Jonas Geiping1,2 1 ELLIS Institute Tübingen & MPI for…

related reading