新一年的基础模型竞赛,未曾预料到的是,阿里千问竟然率先出手了!
就在此刻,Qwen3-Max-Thinking正式版突然发布,立即刷新了全球SOTA:
在涵盖科学知识、数学推理、代码编程的19项权威基准测试中,Qwen3-Max-Thinking甚至超越了GPT-5.2-Thinking、Claude-Opus-4.5和Gemini 3 Pro等顶级闭源模型。
在此之前,这一超大杯推理模型的“早期预览版”已经在AIME 25和HMMT 25(哈佛-MIT数学竞赛)中达到了100%的准确率。
量子位了解到,完全体的Qwen3-Max-Thinking总参数超过万亿(1T),预训练数据量高达36T Tokens,并且进行了更大规模的强化学习后训练。
在核心技术方面,通过引入自适应工具调用和测试时扩展两项技术创新,Qwen3-Max-Thinking的推理性能和调用工具的原生Agent能力都显著提升。
千问APP的PC端和网页端已经第一时间更新了这一Qwen系列最强模型,现在即可免费体验。API(qwen3-max-2026-01-23)也已开放。
话不多说,来看看Qwen3超大杯推理版到底有多强。
编写小游戏对大模型来说早已不是难事,什么贪食蛇、flappy bird都能轻松搞定。
如果再加上难度,让Qwen3-Max-Thinking在网页小游戏里加上手势识别呢?
创建一个基于浏览器的气球射击游戏,使用天空背景,并通过摄像头跟踪用户的手部动作来控制屏幕上的指针。
结果还真能work!在prompt的指导下,细节也都到位:
瞄准动作下,屏幕左上方会显示“瞄准中”的状态;双指捏合触发射击时,能瞬间转换“射击!”提示;如果手出框了,还会出现红色高亮提醒。
完整prompt如下:
“Create a browser-based balloon shooter with a sky background, using the webcam to track a user’s hand and control an on-screen pointer.Core requirements...
...(省略部分代码细节)...此次更新,官方重点强调了两方面的能力提升:推理能力和自主调用工具的原生Agent能力。
正好最近在关注内存涨价这事儿,不妨让Qwen3-Max-Thinking直接帮我们分析一波,写份研报。
...(省略部分代码细节)...在模型上线的同时,阿里千问团队也通过官方技术博客,透露了Qwen3-Max-Thinking的不少技术细节。
...(省略部分技术解析)...本文由主机测评网于2026-06-15发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647650.html