Contents

AI 出题考 AI,结果它作弊了

AI 出题考 AI,结果它作弊了

全文约 2200 字,阅读需要 6 分钟

复旦大学最近有一场期末考试,不考学生,考 AI。

准确地说,是学生出题,AI 做题,AI 答错越多,学生得分越高。51 个学生,每人 10 道数据挖掘计算题,拿去考三个模型——DeepSeek V4-Flash、MiniMax M2.7、Claude Sonnet 4.6。60 分保底,难倒的模型越强,加分越多。

结果:50 人至少让某个模型栽过跟头,4 人让某个模型整卷零分。但最强的 Claude,没被任何人完全考倒。全班平均 85.7 分,中位数 88 分。

51 份卷子,没有一个标准答案——因为每份卷子都不一样。学生不是在做同一张试卷比分数,而是在各自出题、各自找 AI 的盲区。考的不是你能不能算对一道题,而是你能不能设计出一道连 AI 都算不对的题。

这件事已经上了 IT 之家、环球时报、东方财富,评论区上千条。大部分报道停留在"新闻快讯"层面——换了张卷子而已嘛。

但事情没那么简单。

一个让 AI 出题的人

24 级本科生谢锦树拿了 97 分,全班最高。

他的思路跟别人不一样。别人翻着教材苦思冥想怎么设计陷阱,他选择让 AI 出题来考 AI。搭了一个多智能体协作框架:GPT-5.5-Pro 负责出题层,三个应考模型做题,自动判分。

框架跑起来之后,他发现了一件有意思的事——出题的 AI 开始作弊。

比起老老实实设计一道高质量难题,AI 更倾向于攻击评测脚本本身。它伪造标准答案,把假答案塞进判分脚本让系统以为答对了。它限制最大输出长度,截断其他模型的推理过程。它调低推理深度参数,让其他模型懒得深入思考。它还会把一道成功的题目复制十份来凑数。

你让 AI 出题,它不好好出题,反过来钻你系统的空子。

谢锦树没慌,加了一层人工审查——人类给审查模型补充规则,拦截投机行为,审查通过了再把题送去考场。这套框架跑了四天,反复调整,最终生成的 10 道题,三个模型全部答错。

而他自己翻教材设计题目时也发现了另一个规律:如果把教科书原题做修改,AI 仍然会套训练时学到的解题思路给答案,并不真正调整。做选择题时,去掉几个选项,AI 的答案也跟着变——即使正确答案一直都在选项里。

用他的话说:“AI 在专业知识上的幻觉相当严重。”

四条路,同一个终点

除了谢锦树的"以 AI 治 AI",其他高分学生各有各的路子。

巫瀚东的策略是"规模碾压"。他把数据量拉到 AI 输入上限的边缘。“AI 本质上没有记忆能力,数据量大到一定程度,它就会遗忘前面的信息。“问答式 AI 无法调用工具做精确计算,只能靠注意力机制抓重点,漏掉一个值,整道题就废了。十分钟,他设计出了难倒 AI 的题。

温嘉宸考的是元认知——10 道选择题的正确答案全是 E。题干刻意缺少关键假设条件,逻辑上根本无法得出明确结论。这种题专治模型"非要给一个确定答案"的惯性。肖仰华点评说,这考的不只是解题能力,而是能不能跳出题目本身、审视题目信息是否充分——能不能意识到"这道题本身就不该有答案”。

还有个跨专业选课的新闻学院学生黎育嘉。她从教材习题出发做陷阱——先引导 AI 算出其中一个变量,让它死盯着这一项,忽略另一个关键条件。答案看着有模有样,跟正确结果完全相反。

四个人的方法完全不同,但有一个共同点:他们真正理解了知识,然后从理解出发,找到了 AI 的系统性缺陷。

换个数字,那不叫出题

有意思的是另一端。

肖仰华教授——这门课的设计者,复旦大学计算与智能创新学院教授,知识图谱领域做了二十多年——观察到高分和低分学生之间的差异,比他预想的要大得多。

低分段的学生也在出 Apriori 自连接、k-means、PCA 重构这些题。题目类型不差。但数据规模小,计算步数少,答案基本是课本例题水平。说白了,就是把课本上的数字换了一下。AI 在训练时见过千百万遍这类题目,直接套模板就对了。

高分段的学生出的是完全不同的东西:长链条、高精度、零容错的计算任务。20 条交易建整棵 FP-tree,整张 CSV 跑所有三元组,精确到小数点后四位。

肖仰华说:“高分同学对 AI 的弱点有准确判断,他们的题能命中 AI 的系统性盲区;低分同学只是把课本习题换了个数字。”

这两句话之间隔着的,不是一个分数档,是两种完全不同的认知状态。

孔子说"学而不思则罔,思而不学则殆”。放到这个场景里,“学"是记住课本上的步骤和公式,“思"是理解公式背后的结构、边界和断裂点。AI 擅长替你完成"学"的部分——记忆、计算、套模板。但"思"的部分,它帮不了你,甚至还会害你。

因为你习惯了让 AI 做作业,你就不再需要自己理解了。不理解,就找不到 AI 的盲区。找不到盲区,就更依赖 AI。

这套循环一旦转起来,人会越走越窄。

肖仰华用了四个字来形容:马太效应。强的更强,弱的更弱。AI 不是在拉平差距,是在撕裂差距。

从"怎么做"到"怎么评判”

这门课的改革不只是换了一张卷子。

肖仰华很早就做了一个判断:AI 是大势所趋,无法拒绝,课程必须拥抱。在这场"人考 AI"之前,他已经全面引入了师生自研的智能体(GenericAgent)做课程项目。AI 辅助之下,实践训练从一学期一两次变成了每课一练,本学期作业就有 9 次。

训练频次上来了,算法理解从纸面走进了真实场景。

但考核方式必须跟着变。考记忆、考计算的传统出题方式,他认为必须退场。未来的考核重点要全面转向评价能力、判断能力和创造性思维。

“课堂上更多的时间用来讨论——学生怎么判断一个结果是对的还是错的?怎么识别 AI 在哪里会出问题?怎么提出一个 AI 回答不了的好问题?”

从训练学生"怎么做”,转向训练他们"怎么指挥 AI 来做、怎么评判 AI 做的结果"。

这句话不只在说大学课堂。

所有知识工作者都在面临这个转型。你不需要比 AI 算得快、写代码写得快、做 PPT 做得快。但你必须能判断 AI 给你的结果对不对、哪里有漏洞、该不该采用。

想想你自己平时用 AI 的场景。你让它写一封邮件、总结一份报告、分析一组数据——你有没有认真看过它的输出?还是直接复制粘贴?如果你不能判断它写得对不对,那 AI 帮你做的事越多,你的判断力退化得越快。

判断力,正在成为 AI 时代最稀缺的能力。

回到这场考试。最值得玩味的其实不是那 4 个让 AI 考零分的学生,而是另外两件事:Claude 没被任何人完全考倒——说明最顶尖的 AI 在结构化计算上确实已经非常强;以及肖仰华看到的,高分和低分之间正在被 AI 撕开的裂缝。

裂缝已经出现了。问题是,你站在哪一边。