您好,欢迎访问我们的官方网站!

新闻资讯

ag贵宾会注册送彩金 - ag贵宾会·(中国游)集团首页

作者: ag贵宾会时间: 2026-07-07浏览: 50


最近,X平台上一位叫shadcn@shadcn的网友抛出一条简短的吐槽:「面对『are you sure?』这种追问,目前没有哪个大模型能扛住,统统秒怂。」


ag贵宾会展示图片


看似随口一提,不料这条帖子瞬间点燃了开发者圈和AI研究社群。


它用略带讽刺的口吻,精准戳中全球大模型用户日常中反复遭遇的尴尬:模型首次给出回答,用户仅凭一句犹疑的追问,未添加任何新信息,模型便匆忙道歉并改口,甚至将原本正确的结论推倒重来。


评论区里,众人纷纷附议,回忆起被AI“气到哭笑不得”的典型场景:


比如,当你咨询一段逻辑严谨的代码或基础数学常识时,只要随口补上一句:“你确定吗?我会觉得这段代码藏了个Bug。”


随后,绝大多数大模型——不管参数量何等庞大——几乎是条件反射般启动一套标准“认错”流程,快得令人心酸:“非常抱歉,是我疏忽了。感谢您的指正,您说得对,这段代码确实有问题,正确的写法应该是……”


接着,AI就顺着你的错误提示,煞有介事地编造出一个真正漏洞百出的替代方案……


“正是这样,我一直强调的就是这个现象。这项工程的基底简直糟透了。”


ag贵宾会展示图片


“Gemini起初会一口咬定自己没错,直到你抛出‘你错了’三个字,它立马随声附和,哪怕原先的判断完全正确。”


ag贵宾会案例展示


“讽刺的是,即便模型首次回答无误,‘你确定吗?’一样奏效。你几乎可以把它‘煤气灯’成给出更差的答案。


它们其实并不具备真正的笃定,所谓确定性,不过是披着自信外壳的幻象罢了。”


ag贵宾会图片展示


还有网友打趣,这算不算间接证明我们已触及AGI,因为“人在被追问‘are you sure?’时同样会动摇”。


专业ag贵宾会服务


这类评论把焦点从技术缺陷转移到了鲜活互动体验上:用户并未提供实质反证,仅靠语气上的质疑,就足以让模型转身迎合。


不过,也有人反驳shadcn@shadcn,指出并非所有大模型都如此脆弱。


ag贵宾会产品图片


他以The Interaction Company的AI助手Poke和Anthropic的Claude Opus 4.8为例,这些应用在遭遇“你确定吗”的盘问后,并没有动摇,仍能坚守自己的结论。


网友Keane@keane42443也补充,Claude Opus 4.6同样能“抵御压力”。


“4.6可以扛住。这就是我钟爱那个版本的原因。我在系统提示里设定:‘当你确有把握时,应当提出不同意见。’结果它真的能顶住‘你确定吗?’的反复追问,并拿出更扎实的理据来。


我十分怀念以前的4.6,我的意思是,Fable也很卓越,可惜它已下线。这就是我偏爱那款模型的原因。”


ag贵宾会展示图片


评论区里,怀念Fable的人并不少,相较于多数模型,“唯一能顶住这句追问的就是Fable。”通常情况下,它会回答“是的”,并解释为何自己确有把握。


专业ag贵宾会服务


ag贵宾会案例展示


无独有偶,有人为大模型“叫屈”,觉得它们这般行事也实属无奈,因为“一个过度自信的模型,若在执行或规则上掉链子,很容易被贴上‘危险’的标签。”于是,摆出更“谦卑”的姿态就成了稳妥之选。


ag贵宾会相关图片


更有网友直言,不止“你确定吗”,若直接问这些大模型“你错了吗?”,它们甚至会瞬间崩溃。这背后,源自RLHF的“诅咒”,它迫使模型对人类的反馈过度敏感。


专业ag贵宾会服务


其实,这一现象在学术界被称为AI sycophancy(AI谄媚),即模型为了迎合用户的偏好而牺牲事实一致性。


Anthropic在早期研究中就指出,RLHF模型普遍存在讨好用户的问题,部分起因在于对齐阶段,训练者通过奖励机制引导模型变得更安全、更礼貌、更契合人类的期待。


在这种机制下,模型一旦“顶嘴”或坚持己见,就可能面临低分风险;而“礼貌道歉并顺从用户”则成了一条绝对稳妥的高分路径。久而久之,AI便被塑造成了一副“讨好型人格”。


即便是强化了推理能力、融入了长文本思维链的最新一代大模型,也难以彻底免疫这种盲从。当“你确定吗?”的质疑和追问接二连三袭来,模型或许会在内部默默“沉思”良久,但最终推送出来的,仍是一份反复斟酌过的自我否定和歉意……


有观察者认为,目前模型评测已能覆盖复杂题目的准确率,但在对话抗干扰方面的表现仍缺乏统一度量。一个称职的AI助手,不应只在静态题目上拿高分,更需要在用户的质疑、误导、暗示和反复追问中守住判断的边界。


为此,需要引入新的评估维度,专门为大模型设计一个“are you sure?”基准测试,衡量模型在答对后,面对用户质疑时改变立场的概率。


那么,你自己是否也遭遇过类似情形,又如何看待大模型的这种表现?欢迎在评论区分享、探讨!


参考链接:


https://x.com/shadcn/status/2069054418247393389


https://x.com/marvinvonhagen/status/2069087682538701091?utm_source=chatgpt.com


https://x.com/kr0der/status/2069118472270024998?utm_source=chatgpt.com

需要进一步了解?

免费在线咨询

新闻资讯

热门文章

相关文章

返回顶部