文章封面

上一篇聊了软件开发的范式革命——从写代码的“工匠”变成指挥 AI 的“业务指挥官”。所谓“业务指挥官”,就是不再逐行写代码,而是用自然语言描述业务需求,让 AI 帮你实现。

但这里有个容易被忽视的关键:AI 能听懂你的话,但它需要知道你在说什么。

这就是我们今天要聊的话题,AI 真正的硬仗在数据层


一、数据角色的三次跃迁:从附庸到本体

Software 1.0 时代,数据只是被动存储的“账本”。程序员写好逻辑,数据乖乖躺着等查询。数据完全听命于代码。

Software 2.0 时代,数据翻身做了主人。神经网络的权重本身就是数据训练出来的——数据即代码。特斯拉的自动驾驶不是工程师一行行写出来的规则,而是神经网络“吃”了大量路况数据后自己长出来的能力。

Software 3.0 时代,数据要完成最后的蜕变——从静态记录变成活的业务本体

“本体论”这个概念来自 Palantir 的 Ontology 体系:AI 看到的不再是“数据表里的行和列”,而是一个数字孪生——它能理解“这是一台设备,它属于某个工厂,正在执行某道工序”。正是这种能力,让 AI 真正具备了理解和行动的能力。

这才是真正的“数据驱动”。

Software 3.0:从静态数据到活的业务本体


二、为什么数据质量成了 AI 时代的生死线

先讲个反直觉的事:大模型越强大,对数据质量的要求越高。

因为 AI 是个“混乱放大器”。如果提供的数据质量很糟糕,AI 会以你想象不到的速度把这种混乱扩散到整个系统。人类程序员还能靠经验“猜”着绕过坑,AI 只会老老实实按照它理解的数据逻辑执行——哪怕那个逻辑是错的。

什么是 Ontology(本体论)?

本体论叫“数据语义化”更好,奈何 ICT 行业就喜欢制造各种术语 o(╯□╰)o。

简单来说,Ontology 是给 AI 看的“业务说明书”。它把原始数据映射成现实世界的业务对象:

  • 数据不是“equipment_id=12345”,而是“3 号产线的 CNC 机床”

  • 数据不是“status=2”,而是“设备处于待机状态,等待下一批次指令”

  • 数据不是孤立的记录,而是“这台设备的维护历史、当前负载、关联工单”

这种“业务语义化”让 AI 真正理解数据背后的业务含义,而不是基于统计概率瞎猜,从而避免“一本正经地胡说八道”的 AI 幻觉。

本体论体系的三大核心

Palantir 的 Ontology 体系通过三个关键组件构建了业务运作的完整逻辑:

1. 对象与链接(Objects & Links)——数字孪生层

对象代表现实世界的实体(如客户、设备、订单),链接代表实体间的关系(如“设备属于某工厂”)。这为 AI 提供了一个可理解的数字孪生环境。

2. 逻辑(Logic)——业务规则层

封装了定义业务运作方式的规则、分析模型和功能函数。它决定了如何利用数据进行推理和分析,确保 AI 的决策基于准确的业务背景。

3. 操作(Actions)——执行闭环层

这是 Ontology 的动态部分,允许用户或 AI 直接触发事件、编辑源系统数据并执行决策,实现从分析到执行的闭环

以 IoT 物联网领域为例,很像是设备的数字孪生:三个关键对应着设备的属性定义 & 映射、物模型的功能和规则定义、以及设备对外的服务。


三、技术债的质变:从“慢慢还”到“立即付”

理解了本体论,就应该明白为什么 AI 时代的数据质量问题会变得如此致命。

过去:慢性债务可以拖

代码写得乱一点、文档缺失一点,是慢性技术债务,可以慢慢还,靠老员工的“祖传经验”能撑着。

现在:高利贷必须立即还

AI 时代,这笔债变成了“高利贷”——拖一天,利息翻一倍,必须立即还清。AI 会极大放大技术债务,我们从 3 个点说明:

1. AI 是混乱的“倍增器”

AI 编写代码和处理数据的速度极快。如果底层数据层或代码库逻辑不清,AI 会迅速复制并扩散这些错误,产生大量“看起来正确但不可靠”的代码,导致系统崩溃的速度超过人类修复的速度。

2. AI 缺乏“人情世故”

人类工程师在面对混乱的数据层时,可以依靠背景知识进行“合理猜测”,但 AI 是纯粹的概率机器。

AI 编码时通常只能看到一部分代码(技术上叫“上下文窗口”)。)。如果数据层没有清晰的模块划分和明确的接口说明,AI 会做出在当时看起来没问题、但实际上会破坏整个系统规则的修改。

简单说:AI 不理解你的“潜在逻辑”,它只看明文定义的数据结构。

那些藏在老员工脑子里的隐性知识、那些“大家都懂”的约定俗成——在 AI 眼里都不存在。它只会严格按照它看到的数据逻辑执行。

3. 验证成本激增

AI 生成代码的成本极低,但验证这些代码和数据逻辑是否正确的成本极高。

只有在高质量、结构化的数据层之上,才能建立自动化的验证框架。如果底层代码质量低下,自动化工具将无法有效捕捉 AI 产生的微妙逻辑错误。如果这个“底座”质量不佳,自动化执行将带来巨大的运营风险。

这才是真正的“Garbage In, Garbage Out”。在 AI 时代,你欠的每一分钱(技术债务),它都会连本带利地让你立即还清——而且利息高得吓人。


四、工程师转型:从“写代码”到“管数据”

面对这些挑战,工程师的角色必须彻底转变。

工作内容的变化

传统时代:工程师写代码,数据工程师像是“清洁工”——把脏数据洗干净、对齐格式、存进仓库。

AI 时代:每个工程师都要成为“数据管家”——不仅要写代码,还要弄清楚数据在业务上到底代表什么,构建让 AI 能理解的业务本体。

具体包括四个核心能力:

1. 设计本体模型

定义业务对象是什么、它们之间如何关联。这不再是简单的 ER 图(表格关系图)设计,而是需要深入理解业务本质,构建能被 AI 理解和操作的语义层。

2. 语义标注

让数据具备机器可理解的业务含义。包括:将技术字段映射为业务术语、建立实体间的关系图谱、定义业务规则和约束条件。

3. 数据版本管理

像管理代码一样管理数据集的变化。在 AI 时代,数据集就是新的源代码,必须可回溯、可复现、可协作。

4. 数据变化监测

实时监测输入数据的变化。一旦发现数据特征明显偏移(比如用户行为变了、市场环境变了),导致 AI 准确率下降,系统自动触发重新训练。

角色价值的提升

工程师的工作重心从“写循环逻辑”转向“收集、清洗、标记和维护高质量数据集”。

这可能会让一部分程序员感到失落——以前数据工程师算是“二线岗位”,现在却成为 AI 时代的“基础设施架构师”(类似云计算工程师搭建服务器和网络,但他们搭建的是 AI 理解业务的“数据底座”)。

但仔细想想,这种转变其实是价值的提升:当 AI 能够自动生成代码,定义“数据意味着什么”的能力比“如何操作数据”的能力更稀缺。


五、Agentic Workflow:让数据真正“活”起来

数据层准备好了,怎么让 AI 真正用起来?

答案是 Agentic Workflow——把数据从“沉睡的资产”变成“主动决策的引擎”。

PRAL 循环:感知-推理-行动-学习

这个流程可以概括为四个阶段:

感知(Perceive)

通过 RAG(检索增强生成)从本体层获取实时业务上下文,或者通过实时数据采集获取鲜活数据。AI 不再依赖静态的训练数据,而是能够实时查询数字孪生模型。

推理与规划(Reason & Plan)

大模型将复杂的业务目标拆解为可执行的子任务。例如,“优化下周的生产计划”会被分解为:检查设备状态→评估物料库存→协调人员排班→生成工单。

行动(Act)

通过调用外部系统的功能(Function Calling)直接执行具体操作:发送邮件、修改数据库状态、触发物流路由、甚至自动下达采购订单。

关键是:没有 Action 能力的数据层,AI 只能“看”不能“动”。 Palantir 的 Ontology 允许 AI 直接编辑源系统数据、触发平台事件,这才是从“分析洞察”到“业务价值”的闭环。

学习与反思(Learn & Reflect)

AI 会自我评估输出质量。如果决策结果不满意,它会调整计划并重新尝试,这种自我修正机制显著提升了决策的稳定性和可靠性。

人机协同的新模式

即使在 AI 时代,人类依然是决策链条中的关键环节:

权限控制:用户可以根据任务复杂度和风险,动态调整给予 AI 的自主权限(简单任务让 AI 全权负责,复杂任务保持人类监督)。

“实验并验证”:软件开发和决策范式转向“先通过提示词‘感受’初步结果,再通过严格的确定性框架进行‘验证’”。高级工程师的角色从代码编写者转变为审查者和集成者,负责捕捉 AI 可能遗漏的业务边界情况。


写在最后:数据基建决定 AI 天花板

上一篇说“意图编排”是 Software 3.0 的核心能力。但意图再清晰,如果底层数据层是乱的,AI 也只能在真空中加速——最终带着系统更快地冲向泥潭。

AI 是大脑,本体论支撑的数据层是骨骼与神经系统。

没有本体论支撑的数据层,AI 将如无米之炊;而有了本体论,数据层将从资产库转变为具备自主决策与执行能力的操作系统

给从业者的建议:向全栈工程师转型

AI 时代,严格的前后端、数据、架构分工正在被打破。未来的工程师需要具备全栈能力——既懂业务数据,又能驾驭 AI 工具。

数据思维成为基本功

不要只盯着代码,要理解业务数据的含义。数据模型设计、业务语义标注、数据质量管理——这些不再是“数据工程师”的专属,而是每个工程师的必修课。

Ontology 设计纳入架构核心

系统架构要从“表结构设计”升级为“业务本体设计”。数据模型不再是简单的表格关系图,而是帮助 AI 理解业务的“知识结构”。

技术债务必须清零

每一处不规范的命名、每一个未文档化的字段,都会成为 AI 时代的“直接税”。在 AI 开始大规模生成代码之前,先把家底收拾干净。

软件行业的范式革命,表面看是编码方式的变化,底层看是数据价值重估。

从“数据支持业务”到“数据驱动业务”再到“数据即业务”——这个演进路径,比任何技术框架都值得关注。


我是渡叔,一个 ICT 行业 20+从业者,正在记录 AI 时代的思考与实践。