当前位置:首页 > 科技资讯 > 正文

简单技巧让大模型准确率飙升:重复问题,效果惊人

惊人的简单性!Google Research最新研究发现:只需简单重复问题,无需复杂推理,大模型的准确率就能从21.33%飞跃至97.33%!

一个简单到近乎「直白」的技巧,竟然能在不启用推理模式的情况下,将大模型的准确率提升至令人瞠目结舌的97.33%!

近期,Google Research揭示了一个既直接又高效的提示词策略。

这一策略颠覆了以往诸如「思维链」、「多样本学习」等复杂的提示工程技巧。

简单技巧让大模型准确率飙升:重复问题,效果惊人 提示词重复 准确率提升 非推理任务 因果盲点 第1张

https://arxiv.org/pdf/2512.14982

在题为《Prompt Repetition Improves Non-Reasoning LLMs》的论文中,研究人员通过数据展示了:

不论是Gemini、GPT-4o、Claude还是DeepSeek这些主流模型,只需运用这一简单技巧,无需施展任何心理战术,即可实现性能的显著提升,最高增幅可达76个百分点!

别小瞧这种简单方法,它的确效果显著。

有网友形象地称之为「吼叫LLM」。

简单技巧让大模型准确率飙升:重复问题,效果惊人 提示词重复 准确率提升 非推理任务 因果盲点 第2张

更值得一提的是,得益于Transformer架构的独特设计,这一看似笨拙的「复读机」策略几乎不会影响到生成速度。

因此,你无需在效率、准确率和成本之间左右为难。

这几乎是一场真正的「免费午餐」!

告别情绪勒索,拥抱复读机战术

对于经常使用AI工具的人来说,各种「提示词魔法」或许已信手拈来。

为了能让模型「更聪明」,工程师们在过去几年里创造了各种复杂的提示词技巧。

起初是「思维链」,引导模型一步步思考;后来是「多样本学习」,给模型提供大量例子;最近还流行起了「情绪勒索」。

人们试图用人类复杂的心理学逻辑去「PUA」这些冰冷的硅基代码。

但Google Research的研究人员对比了七个常见基准测试(包括ARC、OpenBookQA、GSM8K等)和七种主流模型(从轻量级的Gemini 2.0 Flash-Lite到重量级的Claude 3.7 Sonnet和DeepSeekV3)后发现:

在不要求显式推理、只要求直接给出答案的情况下,「提示词重复」在70组对比中胜出47组,无一败绩。

简单技巧让大模型准确率飙升:重复问题,效果惊人 提示词重复 准确率提升 非推理任务 因果盲点 第3张

在非推理任务中,主流LLMs在各类基准测试中使用提示重复与基线方法的准确率对比显示:在70次测试中,提示重复取得了47次胜利,且无一败绩。

特别是在需要模型从长文中「精确检索信息」的任务上,这种提升堪称质变。

揭秘「因果盲点」,重复的力量何在?

仅仅是重复,竟有如此巨大的威力?

这看似简单得有些不合逻辑,但背后有它的科学道理:这涉及Transformer模型的一个架构缺陷——「因果盲点」(Causal Blind Spot)。

尽管当前大模型的智能提升迅速,但它们都是基于「因果」语言模型训练的,即严格从左到右处理文本。

这就像走在单行道上,只能前行不能回头。

当模型读到第5个Token时,它可以「注意」到第1到第4个Token,但对第6个Token一无所知。

这就造成了一个巨大的认知缺陷。

信息的顺序至关重要。

一个「上下文+问题」的请求格式,往往会与「问题+上下文」得到截然不同的结果。

因为后者中模型先读到问题,尚未知道应用哪段上下文,等读到上下文时可能已经忘记问题的一半。

这就是「因果盲点」。

而「提示词重复」这一技巧,本质上是对这一系统进行了优化。

其逻辑是将<QUERY>变为<QUERY><QUERY>。

当模型处理第二遍内容时,虽然仍在向后读,但由于内容重复,它实际上已经「看过」第一遍了。

免费午餐:小模型秒变GPT-4,效率不降反增

以往人们通常认为:

输入翻倍,成本和等待时间也将翻倍。

但如果将提示词翻倍,难道要等待双倍的时间才能得到答案吗?

实际上,从用户感知的延迟来看,提示词重复带来的时间损耗几乎可以忽略不计。

“复读机”避坑指南与安全隐患

“复读机”战术虽然效果显著,但并非万能。