1. 大模型进入落地竞速赛:讲故事的少了,晒单的多了
1.1 从“能做”到“好用”,现场演示内容透露出关键变化
在WAIC会场泡了一整天,最大的感受是——今年大家聊大模型的方式变了。去年同期的展台上,最常见的demo还是“你让它写首诗”“让它编个故事”“让它回答一个百科问题”,观众看完哇一声,然后就没有然后了。今年完全不同,各个厂商展台的屏幕里放的不再是通用问答,而是带着业务系统的真实界面:客服工单怎么自动分派、资产负债表怎么自动抽取、物流路径怎么被压缩、病历文书怎么整理成结构化数据。我在一个展台前站了十来分钟,看到工作人员演示的是一套面向制造业的排产助手,用户用自然语言描述产能约束,系统直接生成多套排产方案并标注出原材料缺口。这个场景放在去年,大概率还停留在PPT阶段。
这种变化背后是行业共识的转向:大家开始反思一个问题——大模型能力强不强的确重要,但更重要的,是它能不能在你的具体业务里稳定干活。逛展的时候我听到一个说法,基本概括了现场气氛:去年比的是谁能把模型做得更大,今年比的是谁能在真实场景里把模型用得更好。讲落地、讲交付、讲收益的分享嘉宾,座无虚席;还在台上讲通用能力如何如何强的,人流明显少。你可以明显感觉到,甲方和乙方都变得更务实了,大家关心的不再是技术参数的账面数字,而是“我花钱之后,流程到底怎么变”,以及“模型输出错了,责任怎么兜”。
这种转变的一个直接原因是,底层模型的能力差距在快速收敛。OpenAI、Anthropic、谷歌这些海外巨头之间有差距,国内头部几家模型之间的差距也在缩小——至少在文本理解、生成质量这些通用维度上,普通用户已经很难凭体感分出明显高下。模型本身不再是一个足够宽的护城河,于是竞争焦点自然就转移到了工程化能力上:谁能把模型接到业务系统里、谁能把私有数据处理好、谁能把输出结果的可靠性补上,谁才能真的拿到客户的预算。
1.2 模型选型背后的工程三板斧:微调、知识库、智能体编排
在现场听了几个分享,里面反复出现三个技术关键词:微调(Fine-tuning)、知识库(RAG)、智能体编排(Agent Orchestration)。这三样东西基本构成了当前大模型落地的工程化骨架。
微调适合的场景是,你希望模型的输出风格、格式、专业术语高度固定。比如法律文书、医疗报告、品牌文案,这些内容有强烈的格式要求,用基础模型直接问,偶尔会跑偏。你只需要准备几百到几千条高质量样本,对开源底座模型做一次低秩微调(LoRA),就能把模型在某个垂类上的表现明显拉起来。现场一个做军工检测的企业分享说,他们用5000条历史检测报告微调了一个内部模型,字段提取准确率从78%涨到了96%,整个微调成本不到两万块,部署在一张消费级显卡上就够了。这个案例很典型:微调不是烧钱的事,关键是数据质量和场景聚焦。
知识库(RAG)解决的是另一类问题——私有知识问答。企业大量文档都躺在内部系统里,模型没有提前学过,也不可能为了你的企业重新训练。RAG的思路是把文档切碎、向量化存起来,用户提问时先检索相关片段,再喂给模型做生成。这个方案不需要改模型权重,出问题也好排查。我逛到一个工业设备厂商的展台,他们做的设备故障诊断助手用的就是RAG,把几万页售后维修手册和现场处置记录全部卷进去,运维人员问“这台空压机报E-12故障怎么处理”,系统会先定位到对应手册章节,再结合维修案例给出步骤。因为回答有出处,工程师敢信,甚至会顺着链接点回原文二次确认。
智能体编排则是当业务环节足够复杂时,把大模型、规则引擎、外部API串成一条完整的自动化流程。比如一个外贸订单履约助手,用户说“把新到的这批货安排到周五船期”,智能体会先调用ERP系统看库存,再查物流公司有没有周五的仓位,然后生成报关材料,最后把单据发给客户确认。每一步模型都只是做决策,具体执行靠工具调用。这个方向在展会上热度极高,几乎每个平台型厂商都在讲Agent,我后面会单独展开说。
实操中怎么选?其实不复杂:先看你面临的问题是“输出格式要规范”还是“知识要新要私有”,还是“流程要自动化”。很多人一上来就微调,训完之后才发现模型知识还是不够,应该先把知识库做起来。我的建议是,大部分企业场景优先上RAG,成本低、见效快、可解释性强;微调只在确实需要固定输出风格时再做;Agent编排则是在前两者跑通之后,再往自动化方向演进。这个顺序别搞反。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 具身智能站上C位:人形机器人从“会走”迈向“会干”
2.1 为什么今年的人形机器人看起来突然“变聪明”了
WAIC展馆里,人流最密集的区域之一就是具身智能展区。你还没走到展台跟前,就能听到机械臂转动的马达声和观众的阵阵惊叹。今年人形机器人厂商的数量明显比去年多出一截,而且展出的形态也从“概念验证机”往“场景准产品”方向走了。去年看到的很多机器人,核心动作是行走,能平稳走几步路就已经是全场焦点;今年不少机器人已经在现场做分拣、装配、整理、冲泡这类具体任务。有个展台直接布置了一条袖珍流水线,机械臂在几秒内完成零部件的抓取、对位和拧紧,旁边屏幕上实时显示着任务规划和视觉识别结果。
为什么今年这些机器人看起来“聪明”了一大截?关键不在机械本体进步多少,而在于决策层换了一个引擎。传统机器人靠的是预编程:动线画好、点位标好、动作脚本写好,一旦工件位置偏移或者光照变化,整个流程就乱了。今年普遍采用的新范式是基于大模型来写“思考”环节——尤其是VLA模型,也就是视觉-语言-动作模型。简单说,这个模型能把人类的一句话指令,比如“把红色零件放到左侧托盘”,转化为机器人可执行的完整动作序列。它背后的逻辑是,大模型已经在海量互联网数据里学会了物体识别、空间关系、任务拆解这些常识,机器人只需要把“看懂世界”和“动手操作”这两个模块对接起来就行。
这带来的一个直接改变是,机器人的交互门槛大幅降低。以前指挥一台机器人需要写代码、标点位、调参数,现在是个人就能上手:跟它说一句自然语言,它自己规划怎么干。现场有一家做家庭服务机器人的,演示的是“把桌上那瓶水递给坐在沙发上的人”,整个过程里机器人需要自己导航、识别水瓶、规划抓取姿态、走路到沙发前、递出水瓶。因为每一步都是模型实时推理出来的,所以哪怕水瓶放的位置和演示时不一样,它也能随机应变重新规划。这种泛化能力,正是去年大家还在期待、今年已经部分兑现的东西。
2.2 别只顾着看热闹:数据采集和成本问题依旧待解
热闹归热闹,理性也要在线。在具身智能展区听了几场圆桌讨论,几位产业嘉宾基本不回避同一个核心痛点:数据。大模型在文本和图像上之所以厉害,是因为互联网上有海量数据可以学习;但机器人的操作数据,互联网上几乎没有,每一帧“我抓了一个杯子”的动作数据,都必须从真实物理世界或者高保真仿真环境里一点点采出来。有嘉宾直接报了个数:一条高质量的真实操作数据,算上硬件折旧、人工标注、场景搭建,成本可能高达几十甚至上百元。一次复杂的工业装配任务,要想让模型真正学出泛化能力,至少需要几万条数据支撑。这笔账算下来,一个垂类场景的数据建设投入就是几百万的体量。
数据之外,成本压力也不小。现场展示的人形机器人,单台硬件成本仍然高高在上,电机、减速器、力矩传感器、计算平台,每一块都价值不菲。有厂商在展台角落贴了一张BOM表,让人拍照,上面列着一台原型机的核心零部件成本,加起来超过六位数。量产之后虽然有一定下降空间,但要把整机成本压到普通人能接受的水平,行业普遍认为还得好几年。所以我的判断是,具身智能目前最理性的落地场景,仍然是以工业、仓储、商业服务为主的高附加值环节——比如搬运、分拣、巡检这类重复性劳动密集、人力成本高的岗位,这些岗位的ROI算得过来。至于“机器人管家进家门”,我建议做好长线预期,别急着为演示效果买单。
3. 智能体成为高频词:AI从“能聊”走向“能干活”
3.1 智能体的核心能力拆解:目标拆解、工具调用、记忆机制
如果把今年WAIC各场论坛的PPT拿来做词频统计,“智能体”绝对排在所有技术名词的前三名。厂商、创业者、甲方技术负责人都喜欢这个提法,因为它回答了大家对AI最实在的一个期待:我不只想让它回答我问题,我更想让它把事办了。这里的“事”,小到查个数据、订个会议室,大到走完一单采购审批流程,都有智能体发挥的空间。可以说,过去一年大家口中的Chatbot(聊天机器人)正在快速进化为Agent(智能体),交互方式也从“你问我答”升级为“你说目标,它拆任务”。
智能体和传统聊天机器人最本质的区别,可以归纳为三项能力。第一是目标拆解:用户给一个宽泛的指令,比如“把上个月的销售数据整理成周报发给我”,智能体会自己拆分成“读取数据库-汇总数据-生成图表-套用模板-调用邮件接口发送”这样的子任务序列。第二是工具调用:它不是一个只靠模型内部知识硬答的封闭系统,而是能通过API、插件、代码解释器去检索数据库、操作软件、读写文件。第三是记忆机制:它能记住上下文里提到过的用户偏好、历史决定和进行到一半的任务状态,下次对话不用重新交代一遍。我打一个比方:聊天机器人是一个只动嘴的顾问,智能体则是一个你给个模糊目标、它就会自己查资料、做计划、动手执行、最后把结果交到你手里的外包员工——中间过程基本不用你盯着。
展会现场,最打动我的一个智能体应用是面向审计场景的。工作人员给智能体下达指令:“核验这家供应商过去一年的开票金额和银行流水是否匹配”,系统自动登录财务系统抽取电子发票,从银行接口拉取流水记录,再把两份数据进行逐笔比对,对不上的条目生成差异说明,并附上原始凭证链接。整个过程大约耗时三分钟,如果人工复核,通常需要半天起步。这个应用的价值不在于技术有多前沿,而在于它把大模型的语义理解能力、RPA的流程执行能力和规则引擎的确定性校验拼成了一个完整闭环。
3.2 企业落地智能体的建议:从低风险高频场景先切
当然,智能体也不是一上来就能全面铺开的。我在现场跟几家已经在做企业级Agent的厂商交流,得到的一致共识是:别贪大求全,从低风险、高频次、流程标准的场景切入,跑通一条链路再复制。什么叫低风险高频场景?员工提报销、查制度、找文档、生成例会纪要、自动分类工单,这些都是试错成本低、但每天都会发生的场景。哪怕是智能体偶尔出点小错,修复成本也可控。相反,一上来就让它管资金审批、自动发合同、执行大规模自动化灾难恢复,一旦出错,代价就大了。
另一个关键心得是,落地智能体一定要设计“人机协作”的边界,不要追求全自动。哪怕技术允许,组织管理上也往往需要一个缓冲带。比如工单自动分派,智能体可以先给出分派建议和置信度,由组长一键确认;报表自动生成,智能体可以在群聊里直接发草稿,业务负责人确认后再外发。这种“人在回路上”的模式,既提升了效率,又给了大家适应和信任AI的时间。一味追求无人干预,出了事故之后整个项目被叫停的案例,我听得太多了。
给准备动手的团队一个建议:第一步,先把你业务里最耗人力的3-5个高频流程找出来,画清楚流程节点;第二步,判断哪些节点是可以用大模型替代“理解”和“决策”的,哪些节点依赖既有系统调用;第三步,找一个人工确认节点,设计好异常兜底机制,先跑通一个场景再复制。
4. 算力和数据走到台前:基础设施精细化成为行业共识
4.1 推理成本核算:POC容易,上线后的账要提前算
说实话,这个趋势在展会上不那么显眼,但价值比重不低。今年展厅里,液冷服务器、高性能存储、数据标注与治理、向量数据库这类基础设施厂商的展位,同样围了不少专业观众。头部云厂商的宣讲里,算力不再只是报一个显卡型号和集群规模,而是开始讲“单位Token成本”“推理吞吐”“GPU利用率”“PUE值”。这些指标对于做应用的人来说,才是真正的预算关键。
在论坛上我听到的最扎心的一句话是:“训练成本再高也是一次性的,推理成本才是细水长流。”很多企业做POC测试的时候,只验证了模型输出效果,没算过上线之后每天要跑多少量、每个请求要烧多少Token、并发一上来GPU扛不扛得住。等真正部署上线,第一个月的推理账单出来,才发现比预期高了一个数量级。现场有位做智能客服的CTO分享了一个公式,我印象很深:单次请求成本约等于输入Token单价乘以输入长度加上输出Token单价乘以输出长度,再乘以并发倍数和调用频次,最后按月度汇总。他们一开始没有做“请求瘦身”,系统把整本产品手册全塞进上下文,结果单次成本奇高,后来加了检索和缓存,成本直接降了七成。
所以大家今年的普遍共识是:算力规划要前置,推理成本要在方案设计阶段就纳入评估。具体怎么做?一是尽量精简上下文长度,能检索就不硬塞;二是对高频问答做结果缓存,一模一样的请求不重复计算;三是根据业务峰谷,把负载混部调度,不要为峰值专门买一堆卡闲置着。展会上好几家厂商都在推这种“推理省钱”方案,行业对这个方向的关注度前所未有地高。
4.2 数据工程从幕后到台前:高质量数据比模型更稀缺
算力之外的另一个隐形主角是数据。过去一年几乎所有做AI的人都有一个共同感受:模型能力可以靠开源拿到,但适合自己的高质量数据,没有任何开源社区能给你。整理数据、清洗数据、标注数据的环节,往往占据一个AI项目70%以上的时间。这次展会上,数据服务商的展位明显比往年更多,而且他们不再只讲“我们有多少标注人力”,而是开始讲“数据飞轮”“合成数据”“知识库治理”这些体系化概念。
一家做法律AI的厂商分享了一个细节:他们为让模型准确理解法条中“以上”与“以下”是否包含本数这样的语义细节,专门建了一个法条对照标注库,由具备法律背景的标注员逐条处理。这些人力成本不便宜,但训练出来的垂类模型壁垒也正体现在这里——别的团队就算拿到同样的底座模型,也没法复现这套高质量数据集。这个案例说明,数据工程的本质不是把人海战术堆上去,而是围绕业务目标生产有语义价值的样本。
对于中小企业,我建议从两个方向入手数据建设:一是盘点公司内部已有的结构化数据,特别是那些常年积累的真实业务记录,这本身就是天然的高质量语料;二是有条件的话尽早建立“数据飞轮”意识,也就是让模型上线后产生的使用日志和用户反馈回流成新训练数据,按周度清洗、标注、迭代。模型好不好用,很大程度取决于你的数据能不能持续转动起来。
5. 行业大模型进入深水区:垂直场景比通用故事更值钱
5.1 垂类大模型为什么能活下来
逛到下午的时候,我明显感觉到了一个变化:今年高调宣扬“通用底座打天下”的厂商少了,很多都开始往垂直行业收缩,医疗、金融、制造、法律、教育、能源,每个赛道都有专攻的选手。几乎每个行业馆里都能找到至少一家做垂类大模型的厂商,而且不少已经签了正式合同,不是拿概念来参展。这种现象背后的原因,值得想入局的人仔细琢磨。
垂类大模型能活下来,核心逻辑有三条。一是数据壁垒,前面已经谈到,行业里的高质量私有数据才是真正的护城河,这个门槛不是参数堆出来的,是时间、场景和合规换来的。二是场景know-how,在垂直行业里混过的人才懂那些“看不见的规则”,比如病历术语怎么写、审计底稿有什么格式、工地安全检查表有哪些别扭但必须保留的字段。大模型很聪明,但没有这些know-how的人,连提示词都写不对。三是成本结构更适合中小企业,垂类模型不需要万亿级参数,用7B、14B量级的底座在行业数据上精调,推理成本和部署门槛都低很多,甲方看得见摸得着。
展会现场,背着一沓合同来的行业模型厂商,明显比只背PPT来的厂商更从容。他们讲的不是“我们的模型知识面多广”,而是“我们在哪个科室、哪条产线、哪类案件上,把什么指标从多少提升到了多少”。这种表述虽然在宏大叙事上不性感,但客户愿意买单。
5.2 想入局行业大模型,先想清楚这三件事
如果你正在考虑做行业大模型或者打算用行业大模型创业,我在现场听了一天之后,有三句话想分享给你。
第一句:先找场景,再选模型,别反过来。太多人手里握着开源模型,就到处找场景,最后做出来的东西解决不了任何人的痛点。真正值钱的行业大模型,一定是从某个具体的、痛苦的、重复性的业务环节长出来的。哪怕这个环节非常窄,窄到只有一万家企业需要,只要你真能扎进去,比做一万个大家都能做的通用功能有生命力得多。
第二句:数据工作不是“后期处理”,而是从一开始就决定项目生死的因素。选定场景之后,第一时间去盘点手里有哪些数据、能不能合规使用、质量达到什么程度。如果一个行业数据拿不到、数据量少得可怜,或者数据格式烂到没法清洗,那这个场景再性感,也要果断跳过。数据是行业模型的原料,没有原料的工厂,设备再好也开工不了。
第三句:算清楚账,想清楚交付模式。行业大模型不是一锤子买卖,客户买了之后还要持续迭代、持续调优、持续运维。你要想清楚是卖软件授权、卖订阅服务还是按效果付费,每一种模式的现金流、客户预期、验收标准都完全不同。现场一家给保险公司做理赔审核模型的厂商说,他们干脆按“每单审核通过量”收费,客户一听就理解,决策周期大大缩短。
说句大实话,行业大模型这条路不像基础模型那样有聚光灯,但它更适合绝大多数普通团队进入。通用赛道的尽头是巨头游戏,而垂直赛道的每一个细分角落,都还有大量问题等着一批真正懂场景、愿意沉下心做事的人去解决。
我个人在展馆待到最后,最大的感受还是那个词:务实。去年这时候大家还在争论“大模型会不会取代人类”,今年已经没人纠结这种虚的了,所有人都在琢磨自己手头那个流程能不能再快一点、再省一点、再稳一点。AI真的开始变成流水线上的一把扳手,而不是展厅里的一尊雕塑了。如果你也在关注AI、想用它做点事,我的建议很简单:别急着追下一个热点,回到你自己最熟悉的业务里去,找一个最痛的点,试着用今天文章里提到的任何一个成熟方法去解决它。先跑起来,比反复观望有用得多。
