对话科杰科技副总裁金叶:AI下半场,主动权将更多回到企业和组织手中
“模型拿不到企业的私域数据,也拿不到流程和业务判断逻辑。”在金叶看来,当大模型的“山头”逐渐长成,这些无法从外部获得的东西,正在成为AI下半场企业真正的护城河。
模型能力快速迭代之后,企业使用AI的难点正在发生变化。
在今年的世界人工智能大会上,智能体“Hi! WAIC”被嵌入大会官方App。参会者可以直接询问展商、论坛、展品等信息,也可以让它根据个人需求规划参展动线。

科杰科技副总裁、华东区域负责人金叶告诉财闻,这款应用背后的语料和数据由科杰科技提供。
与前端可见的智能问答相比,更复杂的工作发生在后台。大会各种的数据,需要经过采集、清洗、标注和处理,才能被Agent调用。
金叶同时担任世界人工智能大会的产业对接专家,并长期参与头部企业客户的AI转型项目。在他看来,过去一段时间,市场关注的重点主要集中在模型和算力,但随着模型能力不断提升,企业能否整理、理解和使用自己的私域数据,正在成为AI落地的新门槛。
“上半场的主动权在模型厂商手里,下半场的主动权更多在企业和组织自己手上。”金叶说。
一、AI下半场为什么开始拼数据
财闻:C端用户和媒体更熟悉大模型,但对AI Infra仍比较陌生。AI基础设施目前到底在做什么,行业发展到了什么阶段?
金叶:大的逻辑可以概括为“数、算、模”,也就是数据、算力和模型。
大家最先感知到的是大模型。模型之外还需要算力,国内也在逐步发展自己的GPU。这些是过去一段时间市场高度关注的部分。我们把这一阶段称为AI上半场,大家主要做模型、堆算力,模型的参数越来越多,能力也迭代得很快。
但大家现在逐渐认识到,训练和使用模型都需要数据。市面上能够找到、能够使用的公开数据,已经基本被使用。下一步会进入企业私域数据的领域。
问题是,企业的私域数据怎样才能变成AI应用的底层原料?可以打一个比方,过去使用的是原油,现在需要把它加工成精品油。数据要经过采集、清洗、标注和测评,才能服务Agent、RAG以及模型调优。
这方面还存在很大的空白。企业并不是没有数据,而是不知道如何更好地清洗、加工和利用这些数据。以前的数据可能主要给人看,做成报表或者管理驾驶舱;未来越来越多的数据是给AI使用的。AI要能够理解这些数据、调用这些数据,并基于数据完成具体任务。
所以,AI基础设施不只是算力和模型,也包括数据怎样被采集、存储、管理、加工和使用。随着模型能力继续提升,数据的重要性会越来越突出。所以我们讲,AI下半场拼的是数据。
财闻:市场上从事数据工作的企业多吗?哪些行业目前走得比较靠前?
金叶:入局企业较多,真正能把内部数据转化为优质数据集、为大模型与 AI 应用供给核心数据燃料的玩家十分稀缺。
数据工作很难脱离具体行业。你必须结合行业特点,也要结合企业自己手上数据的特点,去做采集、清洗、标注和测评。所谓高质量数据集,很难有一个适用于所有行业的通用定义,因为它一定要和行业、企业以及具体场景结合。
即使在同一家企业里,不同用途的数据要求也不一样。用于模型后训练的数据、用于Agent的数据、用于知识库的数据,类型和标准可能都会有差异。所以大家都知道高质量数据很重要,但真正落地时,不能简单照搬统一标准。
哪些行业走得比较快,要看行业对AI的理解程度、技术导入程度和人才聚集程度。从目前的情况看,金融和制造业相对走得比较深入。
金融本身就是一个高度依赖科技能力的行业。金融科技拼的是技术能力,也拼人才密度。一些头部金融机构有能力,也有财力做比较深入的研究。
制造业则主要集中在头部企业。头部制造企业对数据的应用相对深入,因为它们已经逐步找到怎样把数据与行业能力结合起来,并形成实际价值的路径。
从大面上看,目前AI在企业里的主要价值还是降本增效。至于AI能不能直接创造一种全新的生产力,我觉得目前还没有大范围看到。很多业务问题人自己都没有完全琢磨清楚,不能简单认为AI一上来就能把这些问题全部想清楚。
财闻:从客户角度看,什么样的数据才是可训练、可复用、可运营的高质量数据?应当用什么标准检查?
金叶:这个问题因行业而异,没有一个标准答案。
首先,企业可以把市面上能够找到的标准纳入进来,包括行业标准、国家标准和国际标准。但标准只是一个基础,在这个基础上,还要结合企业自己的理解。
我觉得数据可以分成两块。一块是通识,也就是通用知识,包括公开标准和大模型可以找到的知识;另一块是专识,也就是专业领域知识。企业怎样理解自己的行业,怎样定义自己的业务对象,对数据有哪些特殊要求,这些内容是通用模型不知道的。
头部企业往往会对行业数据形成一些特别的理解和要求,而这些内容未必能够由通用知识覆盖。
数据标准还取决于应用场景。数据究竟是给Agent使用、给RAG知识库使用,还是给模型微调使用,不同用途需要的数据并不一样。模型处于不同阶段,对数据的要求也可能不同。
所以,高质量数据不能脱离业务谈,也不能脱离场景谈。最终还是要根据具体场景和业务需求反推,以终为始。
二、AI进入企业后,究竟改变什么
财闻:如果不用“湖仓一体”等技术术语,科杰究竟替企业完成了什么?一家企业购买相关产品和服务后,哪些人、哪些工作会发生变化?
金叶:比较通俗的讲,就是在AI时代把数据变成AI基础设施的燃料,对数据进行采集、清洗、标注和模型训练,最终让这些数据能够服务AI。
以前的数据更多是给人使用。企业建设大数据平台后,会在前端开发BI报表、管理驾驶舱或者Dashboard。人通过手机和电脑查看数据,了解生产经营情况,再根据这些数据进行判断和决策。
新的变化是,数据不再只是直接给人看,而是越来越多地提供给AI对象使用。因为数据量越来越大,结构也越来越复杂,不可能全部依靠人逐条查看。企业要让Agent去读取数据、分析数据,再把结果提供给人。
“智能问数”是目前比较容易被企业接受的场景。
过去,老板想了解企业经营情况,可能要由财务部门或者不同业务部门的人去收集数据。大家把数据拿回来,用Excel整理,再合成一张表。老板看完之后还会继续问,比如库存为什么出现问题,问题出在哪里,应该怎样解决。下面的人需要重新拆解问题,再回到各个部门补充数据。
这个过程需要很多人,也存在大量重复劳动。有些企业领导一个月看一次数据,为了准备,相关人员可能要提前忙一个星期。
如果企业已经把数据对齐,打通了数据链路,就可以直接用自然语言与Agent对话。比如老板问:“上个月的经营数据情况怎么样?”Agent可以生成一张比较复杂的分析表,从不同角度和维度进行分析,也可以把可能存在的问题高亮显示出来。
过去需要很多人花一周时间完成的工作,在条件具备的情况下,可能很快就能生成。这里的价值不只是提高制表速度,也包括分析得更细。假如企业的数据清洗得比较好,业务逻辑也已经打通,Agent还可能根据发现的问题,提出一些可能的解决思路,把老板没有想到的角度呈现出来。
世界人工智能大会的“AI搭子”也是一个例子。大会本身是传统的展会业务,但它拥有大量展商、论坛、展品和参会信息。把这些数据清洗和处理后,前端的Agent就可以根据参会者的需求查询信息,甚至设计参观动线。
原来参会者要自己在微信公众号、场馆地图和论坛日程中寻找信息。现在可以直接提出问题,让Agent完成初步的信息匹配。这说明传统业务把数据处理好以后,也可以用AI形成一种新的服务方式。
但Agent更多是辅助和连接。尤其在企业业务中,最终交易仍然基于人与人完成。AI可以帮助人更快找到信息、连接资源和形成初步判断,但人的作用仍然很重要。
财闻:为什么企业做AI不能先建设一个大而全的平台,而要从具体场景倒推?
金叶:AI落地最重要的是先想清楚场景。第一层是企业肯定要使用AI,第二层是怎么使用,具体在哪些地方体现成效。
我们和客户沟通时,往往需要先做一些轻咨询。因为最终要回答的是业务问题,也就是AI怎样帮助这家企业的业务。只有对企业业务有一定了解,才能把问题聚焦到几个具体场景。
数据太多了。如果一开始没有想清楚场景,就铺开一个很大的摊子,很可能会变成企业的负担。大家都觉得数据和AI有用,但做了很长时间没有看到效果,管理者很快就会失去耐心。
所以,所有AI项目都应该从场景倒推。比如企业想做智能问数,就从管理者想看的数据反推,把前面的数据链路梳理出来,完成数据治理和数据清洗。
项目团队需要带着业务视角,很快找到那个“线头”。一旦有一两个场景跑通,企业就能看到正反馈。管理层看到效果后,才愿意投入更多资源和预算继续做。
企业管理者真正关心的问题通常没有那么多。可能是现金流、生意经营情况以及少数几个重要的管理问题。如果这些核心问题可以直接通过AI询问,管理者会觉得这个场景有价值。
它和过去的驾驶舱有相似之处,但逻辑发生了变化。过去是人进入系统看数据,现在是人提出问题,让AI理解和处理数据。但无论采用什么形式,都必须从场景出发。
财闻:为什么说AI落地是一把手工程?企业投入资金后,项目没有真正进入生产环节,通常会停滞在哪一步?
金叶:我认为,AI现在更应该被视为一把手工程。
如果推动项目的人没有企业的核心决策权,后面会遇到一系列困难,包括立项难、获得资金支持难、落地也难。其他人可能也知道这件事很重要,但只要不是一把手真正重视,它就可能被排在其他任务之后,最后很难推动。
我们接触的一家商贸企业,就是总裁亲自出来推动智能问数。这个项目的主要使用者是董事长和总裁,一旦明确这一点,下面的人自然会重视。
AI落地的核心问题,实际上是企业怎样转型。AI是一种工具和辅助手段,更重要的是企业能否抓住新的发展机会。如果一把手愿意投入精力,企业会逐渐形成一种新的文化。但如果没有好的流程,也没有人的思维和工作方式配合,再好的工具也很难真正使用起来。
项目最后没有按照设想落地,也不一定只是技术原因。人是动态变化的,即使项目设计得很好,最终落地结果也可能与最初设想存在很大差异。
以前在外企时,我们会讲“PPT”。第一个P是People,也就是人;第二个P是Process,也就是流程;最后一个T才是Technology,也就是技术。重要性也可以按照这个顺序理解。
如果人的意识没有跟上,准备度不够,也没有相应流程支撑,再好的技术都很难落地。
企业的一些关键知识还存在于员工脑中,这会让问题变得更复杂。我以前参与过一个零售企业的销量预测项目。当时还没有大模型,主要使用算法。项目效果一度不错,但企业里原来负责销量预测的总监反而会抵触。
过去,他们依靠自己的经验,每周完成一次销量预测和报表。算法出现后,他们会担心自己被取代,因此在项目推进中并不配合。当然,当时算法本身也不够成熟,但这件事说明,项目里最复杂的仍然是人。
人有时是项目的促进因素,有时也会成为阻碍因素。AI落地不只是技术问题,也要处理人的认知、工作流程以及员工对岗位变化的担忧。
三、模型能力逐渐拉平后,企业的壁垒在哪里
财闻:未来大模型公司是否只会剩下少数几家?现在仍有很多企业在做大模型和AGI,您怎么看?
金叶:我把它理解成一个“爬山”的游戏。
一个新的山头刚出现时,可能有10家、20家甚至100家公司一起爬。等这个山头逐渐形成,最后留下的头部玩家可能不会超过5家,也就是3到5家。它们已经爬得很高,并构筑了自己的壁垒,下面的小玩家再继续投入,很可能已经玩不起了。
以前,一个产业山头在国内可能需要5到10年才能逐渐形成。现在这个过程明显加快,可能一两年,山头就基本长成了。
对创业者而言,识别趋势是非常重要的能力。看到一个山头已经长成,就不要继续投入大量资源与趋势对抗,而应该寻找下一个山头。人再有能力,也很难和时代趋势对着干。更合理的选择是识别趋势,在趋势的加持下做事。
财闻:随着模型能力继续发展,企业会不会逐渐不再需要“中介”或者“卖铲子”的数据基础设施公司?科杰的核心价值在哪里?
金叶:虽然大家都叫AI基础设施、数据基础设施或者数智底座,但这个产业会有很多不同的细分。
大模型公司有自己的生态,也需要大量数据。在一些很细分的领域,会有企业专门把行业材料加工成适合模型使用的数据。比如一个问答模型要回答得准确,就需要比较准确的问答语料。如果数据里有大量没有价值的内容,对模型来说反而可能形成污染。
所以,数据不只是数量问题,还要针对模型目标进行加工。有人直接提供数据结果,也有人提供处理数据的工具。我们把自己称为“卖铲子”的公司,核心是提供AI数据底座平台。
科杰的核心产品 KeenData Lakehouse 依托于 AI-in−Lakehouse智能原生架构,打通数据工程、模型训推、Agent 工厂全链路,与国产GPU、大模型构成算力、算法到数据基础设施的人工智能产业闭环。
在政府和公共数据领域,需要有人完成数据的梳理、清洗和数据底座建设。在企业侧,不同客户的发展程度也不一样。头部企业可能已经有比较好的数据治理能力,但还有很多企业虽然意识到了数据的重要性,行动仍然相对滞后。
模型厂商不可能完成所有行业、所有企业的数据采集、治理和业务梳理。尤其是企业自己的私域数据、业务流程和判断规则,需要企业或者与企业关系更紧密的服务方共同完成。
但这也对数据基础设施公司提出了更高要求。不能只是卖一个通用产品,而要理解客户的业务,把产品长成客户需要的样子。AI没有统一的落地答案,很多项目需要和头部客户一起共创,再把形成的经验逐步复制到行业中的其他企业。
企业最终还要判断,什么项目有助于产品迭代,什么项目有助于营收,项目的投入产出是否合理。服务商也要不断选择和匹配。项目机会很多,但不是所有项目都适合做。这个过程仍然需要人,也需要对客户和行业的理解。
财闻:您提到AI上半场主要竞争模型和算力。AI下半场的竞争会发生哪些变化?
金叶:上半场的主动权主要在模型厂商手里,下半场的主动权会更多回到企业和组织自己手中。
随着模型不断向前发展,大家对不同模型的期待会逐渐拉平。现在很多模型已经具备企业需要的一些基本能力。模型从0到1时,差异非常明显;进入从1到10、从10到100的阶段后,企业对模型能够稳定完成什么任务,会形成相对确定的理解。
模型现在已经很强,也在不断寻找场景。只要企业提供场景,模型可以通过算法快速枚举,从很多角度寻找解决方案。一些过去人认为很难解决的问题,模型也可能提供新的思路。
但模型拿不到企业的私域数据,也拿不到企业内部的流程、业务逻辑和规则。这些东西是企业自己的护城河,模型厂商很难直接获得。
这也是企业在下半场最大的壁垒和机会。
企业需要建立自己的语义和业务逻辑。比如一家制造企业,BOM在这家企业里怎么定义,供应链包含哪些对象,上下游关系是什么,这些属于企业自己的语义层。在语义层之上,还有业务逻辑和判断层。
当企业把这些内容建立起来,形成自己的知识体系或者“本体”,它可能成为下一阶段最重要的竞争力。外部通用能力可以交给模型,但企业自己的数据、流程、语义和业务判断必须沉淀下来。
这也是为什么一些专业的垂直应用公司和SaaS公司未来可能面临压力。它们过去提供的部分能力,大模型可能比较容易完成。基模厂商推出一个新的能力或者Skill,就可能覆盖一些原来由小型应用公司提供的功能。
如果不是基础模型厂商,创业公司就应该更加靠近用户。只有与用户站得更近,深入企业的私域数据、流程和业务判断逻辑,才可能形成自己的生存空间。
可以把它理解成企业建立一个私域数据库或者知识库。这个知识库不只是存放资料,还包含企业的判断和行业认知,能够帮助企业快速作出决定。在外部再连接一个模型,就可能形成下一代竞争力。
大模型已经能够协助编程,业务人员也可以通过自然语言构建一些应用。代码本身的门槛正在下降。真正值钱的,仍然是对业务的认知、对行业发展趋势的认知,以及把这种认知变成产品的能力。
所以,AI落地的最后一公里,不只是把模型接进企业,而是帮助企业把模型能力与自身数据、流程、规则和认知结合起来,形成独特的竞争优势。

