Funny Eval
进行中跑分看不出模型真正的能力。我想用直观、好玩的方式把能力差距逼出来——一眼能看懂输赢的题目,才值得做。
- 分四个颗粒度考:context、tools、model、agent,每层该有什么能力就考什么
- 只挑最能拉开差距的环节,所有模型都做得到的不值得出题
- 盯着无法量化的那部分:分数给不出的能力,才是我想看见的
- 题目做成黑盒:不给规则,只给痕迹,让模型自己把世界推出来
- 评测本身要好玩,否则没人看——包括我自己
项目1
<div class="pj">
构思中
黑盒迷宫只给模型小球的轨迹,让它推出整张迷宫地图
构思中
</div>