在万众期待中,GPT-5.3和Gemini 3.5的发布潮并未如期而至,本周的焦点却被阿里的Qwen3-Max-Thinking抢占了风头!
1月26日晚,阿里巴巴隆重推出了Qwen3-Max-Thinking,这是其千问系列中能力最强的旗舰级推理模型。在19项权威基准测试中,Qwen3-Max-Thinking与GPT-5.2-Thinking、Claude-Opus-4.5和Gemini 3 Pro等顶尖模型展开了激烈角逐,搭配测试时扩展(TTS)能力后,它在不少基准测试上达到了SOTA。
Qwen3-Max-Thinking究竟新在哪里?首先,它具备了自适应工具调用能力,可按需调用搜索引擎和代码解释器,大大简化了用户手动选择工具的繁琐过程。或许是出于对模型工具调用能力的自信,千问甚至直接将对话框的搜索标识删除了。
该模型还融入了阿里独创的测试时扩展思路。不同于业界常见的“堆并行推理路径”做法,Qwen3-Max-Thinking并未盲目增加并行分支,而是将有限的计算资源集中投入到更“聪明”的推理过程本身,使模型推理更加精准、高效且具备“反思”能力。
早在去年9月,阿里便曾上线Qwen3-Max的Preview版本。相较于Preview版本,正式版实现了思考和非思考模式的有效融合。Qwen3-Max的上下文窗口为256k,参数量暂未公布,但应超过1万亿个参数。
Qwen3-Max-Thinking并非开源模型。目前,它已上线Qwen Chat,用户可在该平台体验模型的自适应工具调用功能。同时,Qwen3-Max-Thinking的API也已开放,价格为2.5元/百万输入tokens、10元/百万输出tokens,具有较高的性价比。
值得一提的是,阿里在同一天还开源了Qwen3-TTS全系列语音合成模型,支持音色克隆、音色创造、拟人化语音生成以及基于自然语言描述的语音控制。
体验链接:
https://chat.qwen.ai/
API调用平台:
https://bailian.console.aliyun.com/cn-beijing/?tab=model#/model-market/detail/qwen3-max-2026-01-23
Qwen3-Max-Thinking上线后,我们第一时间进行了体验。
我们首先测试了Qwen3-Max-Thinking的自适应工具调用能力。这是通过专门的训练流程培养出来的能力:在完成初步的工具使用微调后,模型在多样化任务上使用基于规则和模型的反馈进行了进一步训练。
自适应进行搜索的能力已经较为常见。无论是DeepSeek还是ChatGPT,都能在一些涉及即时信息的查询中主动搜索。Qwen3-Max-Thinking同样如此,例如,当被问及今天的天气时,它会主动搜索并给出准确回答。
对于没有明显时效性提示的内容,Qwen3-Max-Thinking也能自主调用搜索。例如,当被问及“Clawdbot是啥”时,模型先思考了一会儿发现没有相关知识,然后便开始搜索并给出完整介绍。
这一点ChatGPT中的模型就做得不太好。它认为自己的知识库里没有的东西就是错的,没有进行搜索和核验。
例如,当让Qwen3-Max-Thinking“模拟抛掷一枚均匀硬币1,次,统计正面朝上的次数并验证大数定律”时,它便开启了代码解释器并编写了60多行Python代码来完成任务。它用Python生成的图标内容是正确的但画风较为朴素。
在推理时阿里为Qwen3-Max--Thinking采用了一种经验累积式、多轮迭代的测试时扩展策略。
不同于简单增加并行推理路径数量(这往往导致冗余推理),Qwen3--Max--Thinking限制了路径数量并将节省的计算资源用于由“经验提取”机制引导的迭代式自我反思。
size-
val='' src='https://img.36krcdn.com/hsossms/
27/
v_a5...'/></>/>/>/>/>/>/>/>/>/>/>/>/>/>/>/>'/alt='编程审美进步'// >
本文由主机测评网于2026-06-15发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647675.html