示意图:来自不同国家和年份的散乱数据点,被对齐到右侧统一坐标网格中
图:示意图把一份清单拆成作物、电力、肥料、包装和运输五个数据来源,标出各自的国家与年份错位。

一份清单,五个来源,五套口径

假设要给一款罐装番茄做LCA,手头的数据是这样拼起来的:番茄产量与施肥量来自国家甲2016年的农场调查;加工用电取自国家乙2023年的电网数据;铁罐包装用一个全球平均数据库;运输用另一个数据库,其边界包含空车返程;灌溉用水则按国家丙的平均值估计。五个来源各自都没有问题,拼在一起却是五套口径。纵横国际把这种情形称为拼盘式清单,风险不在某个数字错了,而在没人说得清整份结果代表哪个地方、哪一年。

五个维度:错位出现在哪里

维度 常见错位 偏差方向 对齐做法
Geography 地区用甲国平均施肥量代表乙国农场施肥、灌溉、单产差异被抹平 优先用目标产区数据,不得已时标注代理地区
Time 时间 数据年份相差多年 电网变化、品种与单产变化被忽略 做年份修正,至少标注年份跨度
Energy Mix 能源结构 用全球平均电力代表某地工厂排放因子可能相差数倍 用当地电网结构替换电力过程
Production System 生产体系 露地与设施、雨养与灌溉混用 水、能源与肥料投入被平均 按生产体系分别建模
System Boundary 边界 一个数据库含包装生产,另一个不含 重复计算或遗漏统一到同一边界再合并

电力:同一度电,两个世界

电力是最容易检验的一项。假设加工线每吨番茄耗电100千瓦时,国家乙的电网每千瓦时排放0.2个设定单位,国家丁为0.8个设定单位,相差4倍。这条产线在乙国的用电排放为20,在丁国为80。如果偷懒使用一个平均值0.5,两个地方都会被算成50:乙国被算成实际的2.5倍,丁国则被低估近四成。数字全是设定,只用来说明平均值怎样抹平差异。

时间:数据的年份也是变量

假设某国电网的排放强度五年内下降了三成,用五年前的数据去算今年的加工,用电一项就被高估约43%。作物侧同样如此:干旱年与常年的灌溉量不同,品种更换和单产提升也会改变每公斤作物分摊的投入。2026年《Frontiers in Nutrition》一篇营养生命周期评价的观点文章把区域数据缺口列为持续的挑战。缺口出现时,人们往往拿邻近地区或更早年份的数据顶上,错位也就从这里开始。

生产体系与边界:最隐蔽的两种错位

生产体系的错位很难从数字上看出来。假设某作物在一个国家以雨养为主,在另一个国家以灌溉为主,把两地数据混用,灌溉与能耗被平均成一个哪里都不存在的“中间状态”。边界错位更隐蔽:两个数据库都有一项叫“包装”,一个含原料开采,一个只含制造,合并以后要么重复计算,要么遗漏。它与系统边界怎样选择是同一个问题,只是发生在数据层,而不是在方法设计层。

对齐的处理顺序

数据对齐的处理顺序
盘点每个来源的地区、年份与边界统一单位与边界电力与肥料等关键过程地区化按年份做时间修正给每个输入标注不确定性范围传播并检验结论

不必逐项精修,先找对结果贡献最大的几项:上面的例子里是电力和施肥,包装数据的年份差异则可能无关紧要。

不确定性传播:给答案一个范围

对齐做不到完美,就要把没对齐的部分显式表达出来。蒙特卡洛(Monte Carlo)模拟是一种概念上很直接的做法:给每个输入设定一个合理范围,例如电力排放因子在0.15至0.3之间、施肥量落在某个区间,让计算机在范围内随机抽取几千次,每次算一遍,最后得到的不是一个数字,而是一个分布。两款食品的分布大量重叠时,就不该宣布谁更好,这与前述观点文章提醒的“对微小差异的过度解读”是同一个风险。

要点:对齐不追求让每个数据都完美,而是让每个数据的地区、年份、边界和不确定性都被看见。被推断出来的数字,必须带着“推断”的标签进入结果。

AI 能帮什么,不能帮什么

AI在这里主要有两项用途:数据匹配,把不同数据库里名称不同的同一过程配成对;缺失填补,用相似地区、相似年份的数据推断缺口。这两项都能省下大量人工,局限也一样明确:填出来的数是推断而不是测量,必须保留来源标签和区间,否则后面的人会把它当成实测值。

数据实时化也不会自动解决对齐。2024年的一篇系统综述讨论了实时数据监测如何支持动态生命周期清单,物联网可以采集工厂与物流中的能量、物料和环境条件流。但传感器有自己的边界、单位和时间戳,同样要先对齐,才能与农场数据、二次数据库放进同一份清单。这条数据链的设计见食品生命周期一年做一次以后为什么要接入实时数据,同一原料在不同来源里有多个名称的问题,则见纵横国际大模型怎样连接营养、原料、生命周期和水足迹数据。纵横国际在食品生命周期栏目中的做法,是让每个数字都能追溯到来源、地区、年份与边界。