当前位置:首页 > 科技资讯 > 正文

AI训练模式迎新变:从通用到专用,重塑行业生态

AI训练模式迎新变:从通用到专用,重塑行业生态 AI训练模式 专用模型 行业生态重塑 硬件突破 第1张

AI研究范式或迎来根本转变:业界呼吁摒弃“先预训练后微调”的通用模式,转而采纳在训练初期就针对特定目标(如代码编写、客服服务)引入精选数据的策略。这一变革若成主流,AI开发将告别“全能模型”,转向构建多个从零开始的“专用模型”,进而重塑行业生态及团队结构。

随着人工智能领域的竞争步入深水区,顶尖研究者正对现有模型训练范式提出质疑。

来自OpenAI、Thinking Machines Lab及亚马逊的研究人员正探讨一项根本性变革:放弃当前通行的“先预训练、后微调”流程,转而采取在特定任务早期就引入精选数据的训练模式,以期解决现有模型的效率瓶颈及“裂脑问题”。

亚马逊的David Luan等人正大力推动这一潜在转变。他们的核心观点是,当前先赋予模型广泛知识(如诗歌或园艺),再针对特定任务(如代码编写或客户退款)进行微调的通用训练路径,在逻辑上并不总是合理。研究者认为,若模型用途已确定,那么在预训练阶段就应引入与任务高度相关的精选数据,以更直接地服务于最终目标。

这一方法论调整若付诸实践,将深刻改变AI行业的开发格局。这不仅可能使开发团队无需再按预训练和后微调进行人为分割,更预示着市场将步入“基于不同数据集构建专用模型”的时代,而非依赖单一通用模型。这一转变将促使开发者在训练初期就严格筛选数据,以界定模型在特定领域的专长与短板。

01

重塑训练逻辑:摒弃冗余,聚焦高效

当前的AI训练规范在某种程度上模仿了人类学习过程,即先积累广泛知识,再学习特定技能。然而,行业内部开始反思这一流程的效率。David Luan指出,对于旨在处理代码或客户服务的模型而言,花费大量算力学习不相关领域(如诗歌或园艺)是资源浪费。

尽管“广撒网”式的预训练看似直观,但也导致了诸如“裂脑问题”等技术瓶颈。新策略主张将预训练过程用于接触与任务更相关的精选数据。OpenAI和Thinking Machines Lab的研究人员对此表示赞同,部分人士甚至建议取消不同训练阶段的独立团队,整合为一个统一团队以提高针对性。

02

专用模型崛起与组织重构

这一变革将对AI模型的最终形态产生深远影响。研究者必须在训练早期就决定纳入哪些数据,这将直接决定模型的能力边界。例如,增加数学和代码数据而减少散文数据,可能会造就卓越的编程助手,但牺牲其在创意写作或情感交流方面的能力。

这将导致未来AI市场不再依赖于对同一预训练模型的后期修补,而是涌现出大量基于不同基础数据集训练的专用模型。据OpenAI内部情况,公司已意识到这种需求分化。一方面是消费者希望ChatGPT回答简单问题并充当聊天伙伴,另一方面是公司致力于推理模型和超级智能的前沿研究。

目前,OpenAI虽所有模型仍基于同一预训练模型,但已通过路由技术和特定版本(如GPT-5-Codex)应对复杂性。若未来转向为不同目的训练完全独立的模型,公司将需对研究团队进行彻底重组。

03

硬件突破与资本注入

在软件训练模式变革之际,硬件领域的创新也在加速,资本正密切关注能提升能效的新技术。光子芯片初创公司Neurophos刚完成由比尔·盖茨旗下Gates Frontier领投的1.1亿美元A轮融资,微软旗下的M12也参与其中。

Neurophos致力于设计利用光而非电子进行AI数学运算的芯片。据该公司联合创始人兼CEO Patrick Bowen介绍,目标是在2028年交付一款芯片,其速度和效率将是英伟达Blackwell芯片的50倍。微软高管Marc Tremblay表示,现代AI推理对电力和算力的需求巨大,行业亟需计算层面的突破。

与此同时,OpenAI也在加强基础设施建设。OpenAI首席财务官Sarah Friar在世界经济论坛上透露,公司定制推理芯片正在进行“流片”,即制造前的最后一步。她还表示,去年宣布的价值超5000亿美元的Stargate基础设施项目已建成过半,且“进展超乎想象”,公司已在甲骨文的Stargate园区服务器上训练模型。

04

行业整合与竞争动态

AI领域的并购与融资活动持续活跃。据The Information数据,旨在定制AI模型的软件公司Lightning AI与数据中心提供商Voltage Park合并,新公司估值超25亿美元。此外,Yelp同意以3亿美元收购AI代理初创公司Hatch。谷歌DeepMind则通过许可协议聘请了语音AI初创公司Hume AI的CEO及多位顶尖工程师。

在巨头动向方面,据彭博报道,苹果正与谷歌谈判,计划利用其云基础设施及TPU芯片推出更新版Siri,并计划最早于2027年推出AI驱动的可穿戴设备。英伟达CEO黄仁勋据报正准备前往中国,试图在该战略市场重新站稳脚跟。

在监管与伦理层面,Anthropic发布了Claude的新版“宪法”,相比2023年初版减少了指令性,给予模型更多判断空间,并罕见提及模型可能具有某种“意识”或“道德地位”的可能性。白宫经济顾问委员会则发布报告预测,生成式AI将引发美国经济的深刻转型,有望显著提振生产力和增长。