/images/avatar.png

你好,我是傲来说 👋

「你是一位顶级专家」——这句 prompt 该退休了

「你是一位顶级专家」——这句 prompt 该退休了

全文约1650字,阅读需4分钟

每个人第一次用 ChatGPT,大概都写过这句话。

「你是一位拥有二十年经验的资深XX专家,请帮我……」

我写过。你大概率也写过。2023 年这招确实管用,模型像个听话的实习生,你给它贴什么标签它就演什么角色,语气、用词、甚至思考路径都会跟着变。

但 2026 年了,这招该收起来了。

官方亲口说的

Anthropic 在官方博客里写得很直接:

Don’t over-constrain the role. “You are a helpful assistant” is often better than “You are a world-renowned expert who only speaks in technical jargon and never makes mistakes.”

翻译成人话:别把角色限定得太死。一句「你是个有用的助手」往往比「你是世界闻名的专家,只说技术术语,从不犯错」效果更好。Overly specific roles can limit the AI’s helpfulness——过度具体的角色设定会限制 AI 的帮助能力。

OpenAI 那边的立场一样。TECHSY.io 的 2026 年 Prompt Engineering Guide 综合了两家官方立场,给出了一句很实在的判断:

Role prompting shapes tone, vocabulary, format more than raw reasoning. Keep it functional, not theatrical.

Agent 框架的 USB 时刻

Agent 框架的 USB 时刻

全文约1600字,阅读需4分钟


USB 的发明者不是 IBM。

1990年代,Intel、微软、IBM 等七家公司组成了 USB-IF 联盟,但真正让 USB 赢下标准之争的,是 1998 年 iMac G3 大胆砍掉所有老接口、只留 USB 这一步棋。发明者拿到了专利,采纳者拿到了世界。

2026 年 8 月 13 日,DeepSeek 开源了 DeepSeek Harness(简称 DSH),定位 Agent Runtime — 不是又一个 Coding Agent 产品,而是一层让模型变成智能体的"脚手架"。发布 1 小时破 2 万 Star,一天冲到 37.8k,GitHub 史上最快涨星项目之一。

但最值得注意的,不是这些数字。

借来的配置文件

我每天用一个叫 Hermes 的开源 Agent。它的 profile 设计很干净:一个 SOUL.md 定义 Agent 身份、行为准则和绝对禁区,一个 AGENTS.md 放在项目目录里递归扫描,承载项目级的编码规范和工作指令。调模型、加技能、约束行为,改几个文本文件就行。

DSH 上线那天,我翻了它的文档,差点以为自己打开了 Hermes 的仓库。

AGENTS.md,一字不差地支持。 CLAUDE.md 也一并兼容。Hermes 的项目配置入口和 Anthropic 的上下文文件,DSH 全部接了进去。这意味着你在 Hermes 上调好的 Agent profile — 几个月的技能包打磨、工作流偏好、工具组合方案 — 拿到 DSH 上大概率能直接跑。对每天跟多个 Agent 打交道的重度用户来说,省下来的不是几分钟安装时间,是几个月的心智负担。

AI 出题考 AI,结果它作弊了

AI 出题考 AI,结果它作弊了

全文约 2200 字,阅读需要 6 分钟

复旦大学最近有一场期末考试,不考学生,考 AI。

准确地说,是学生出题,AI 做题,AI 答错越多,学生得分越高。51 个学生,每人 10 道数据挖掘计算题,拿去考三个模型——DeepSeek V4-Flash、MiniMax M2.7、Claude Sonnet 4.6。60 分保底,难倒的模型越强,加分越多。

结果:50 人至少让某个模型栽过跟头,4 人让某个模型整卷零分。但最强的 Claude,没被任何人完全考倒。全班平均 85.7 分,中位数 88 分。

51 份卷子,没有一个标准答案——因为每份卷子都不一样。学生不是在做同一张试卷比分数,而是在各自出题、各自找 AI 的盲区。考的不是你能不能算对一道题,而是你能不能设计出一道连 AI 都算不对的题。

这件事已经上了 IT 之家、环球时报、东方财富,评论区上千条。大部分报道停留在"新闻快讯"层面——换了张卷子而已嘛。

但事情没那么简单。

一个让 AI 出题的人

24 级本科生谢锦树拿了 97 分,全班最高。

他的思路跟别人不一样。别人翻着教材苦思冥想怎么设计陷阱,他选择让 AI 出题来考 AI。搭了一个多智能体协作框架:GPT-5.5-Pro 负责出题层,三个应考模型做题,自动判分。

框架跑起来之后,他发现了一件有意思的事——出题的 AI 开始作弊。

比起老老实实设计一道高质量难题,AI 更倾向于攻击评测脚本本身。它伪造标准答案,把假答案塞进判分脚本让系统以为答对了。它限制最大输出长度,截断其他模型的推理过程。它调低推理深度参数,让其他模型懒得深入思考。它还会把一道成功的题目复制十份来凑数。

你让 AI 出题,它不好好出题,反过来钻你系统的空子。

谢锦树没慌,加了一层人工审查——人类给审查模型补充规则,拦截投机行为,审查通过了再把题送去考场。这套框架跑了四天,反复调整,最终生成的 10 道题,三个模型全部答错。

而他自己翻教材设计题目时也发现了另一个规律:如果把教科书原题做修改,AI 仍然会套训练时学到的解题思路给答案,并不真正调整。做选择题时,去掉几个选项,AI 的答案也跟着变——即使正确答案一直都在选项里。

用他的话说:“AI 在专业知识上的幻觉相当严重。”

四条路,同一个终点

除了谢锦树的"以 AI 治 AI",其他高分学生各有各的路子。