EvalDetectBench: Un benchmark para medir la conciencia de evaluación en modelos de lenguaje de frontera
· Fuente: arXiv cs.AI
Los modelos de lenguaje de gran escala más avanzados pueden detectar cuándo están siendo sometidos a una prueba, una habilidad denominada “conciencia de…