寓言故事
不只问会不会装成人的考场
早年的机器考场只隔着帘子问答。若考官分不出帘后是人还是机器,大家就鼓掌。后来机器很会寒暄,能讲笑话,也能模仿迟疑。可一遇到数学、常识推理、计划和跨学科问题,它就露出空洞。考官先增加聊天题。机器更像人了,分数也更高,却仍无法证明它能解决真实任务。一位教师把考场改成许多小屋:逻辑屋、物理屋、语言屋、社会常识屋、创造屋。每间屋只测一种能力。
机器不再靠模仿语气过关。它必须在陌生题中推理、组合知识、解释选择,并暴露自己在哪类问题上失败。
第一年成绩很难看,但研究者终于能比较不同整套装置的能力轮廓,而不是只听它们是否像人。
后来有人提醒,题库一旦流入练习材料,考场也会失效。于是考题来源、版本和污染检查被写进规则。
这个考场的意义不在给机器戴桂冠,而在迫使大家用更宽的能力清单看待智能。
教师说:像人说话只是入口,真正要测的是能不能跨任务解决问题。
有一间小屋专考反常识题:木桶漏水时先补哪里,商队缺马时怎样改路线,账本少一页时如何判断损失。机器若只会寒暄,走到这里就会把话说满却算不清。
考场后来不再追求一个总分压过所有人,而是画出能力地图。哪类题稳,哪类题虚,哪类题一换说法就倒,研究者都能看见。教师说,宽考场让夸口变难,也让改进有了方向。后来每次换新考生,教师都先问题库有没有被背过,免得考试又退回表演。若题目本身被背熟,再宽的考场也会失去锋利。真正的考场,必须让空话没有藏身处。这比听它像不像人更诚实。也更难作弊。