参考线理论:土壤碳 LIBS 的 C–Fe 谱线干扰校正
用激光诱导击穿光谱(LIBS)测土壤碳时,常用的碳特征线 C I 247.8561 nm 会被富铁土壤中的铁发射干扰,导致碳含量被高估(文献报道可高估 15%–58%)。"参考线理论"就是一类解决这个干扰的方法:找一条独立的铁谱线作参照,用它推算目标窗口里铁贡献了多少,再把这部分扣掉。这篇笔记把这个理论的公式链梳理清楚,并结合项目的实际数据说明它到底好不好用。
一、两条谱线怎么混在一起
目标窗口在 247.70–248.08 nm 附近。碳的 C I 247.8561 nm 线旁边,紧挨着一条铁线。不同文献对这条铁线的归属标注并不一致:有标 Fe II 247.8572 nm 的,有标"Fe 247.98 nm"的;本项目依据 NIST 归属,把它定为 Fe I 247.976 nm(右肩)。
问题的本质是:仪器的光谱分辨率只有约 0.07 nm,这两条线几乎重合,测到的是一个"复合包络",无法直接看出其中碳和铁各占多少。参考线理论的核心思路就是用窗口外的一条铁线,去"猜"窗口内铁线的贡献。
二、两篇文献给出的两种做法
2.1 Ma 等(2021,Geoderma):高分辨 + 最小二乘
Ma 等用高分辨率光谱仪把 C 线和邻近的 Fe II 247.8572 nm 线分开,然后借助一条 Fe 参考线(Fe II 249.7819 nm)做最小二乘校正。他们的逻辑是:目标窗口的总强度 = 碳贡献 + 铁贡献,而铁贡献可以通过参考线按一定比例推算出来。
2.2 Bai 等(2016,JAAS):粉煤灰经验铁线比
Bai 等研究的是粉煤灰中未燃碳的 C–Fe 干扰。他们在纯铁材料(Fe₂(SO₄)₃)上实测了几条 Fe 线的强度比,用 Fe 248.33、250.11、251.08 nm 作为校正线,其中 Fe 248.33 nm 给出了最好的多元校正结果(R² = 0.998)。
三、参考线理论的核心公式
3.1 理论基石:谱线强度比(玻尔兹曼关系)
为什么可以用一条参考线去推算另一条铁线的强度?在局部热力学平衡(LTE)近似下,同一元素、同一电离态的两条谱线的积分强度比由下式决定:
符号含义
It、Ir:目标线、参考线的积分强度
At、Ar:两线的跃迁概率(Einstein A 系数)
gt、gr:上能级简并度
λt、λr:波长;Et、Er:上能级能量
k:玻尔兹曼常数;T:等离子体温度
这个公式是参考线方法的物理根基,它告诉我们:两条线的强度比不是任意的,而是由原子常数和等离子体温度共同决定的。当两条线的上能级能量接近时,指数项 exp[−(Et−Er)/(kT)] 趋近于 1,强度比对温度的波动就不敏感,比值就稳定——这正是挑选参考线时要求"上能级相近"的原因。
3.2 从强度比到校正方程
有了强度比,就可以把目标窗口里铁线的贡献"翻译"成参考线强度的某个倍数。Ma 等(2021)的做法可以概括为两步:
第一步,把 247.86 nm 处的总强度写成碳贡献与铁贡献之和:
第二步,用参考线强度按固定系数估计铁贡献:
然后用最小二乘法同时估计校准系数 k 和碳贡献 IC。这里有一个关键转折:式 (1) 给出的理论比率只在理想条件下成立。Ma 等自己在论文里也提醒——自然土壤中"纯"的铁 247.8572 nm 强度根本观测不到,所以实际必须用经验系数去替代理论比率。这个"理论与现实的差距",正是后面项目结果里反复出现的主题。
3.3 实际拟合的基础:伪 Voigt 谱形
要在一个复合包络里把碳峰和铁肩拆开,需要给每条谱线一个可拟合的谱形函数。项目用的是面积归一化的伪 Voigt 函数(Gaussian 和 Lorentz 的线性组合):
其中 μ 是峰中心,w 是半高全宽(FWHM),η 控制高斯/洛伦兹的比例。高斯项对应仪器分辨和多普勒展宽,洛伦兹项对应压力/Stark 展宽,各取一半是 LIBS 里常用的折中。
3.4 局部双组分模型(M1)
在目标窗口里,用一个"碳中心复合峰 + 铁右肩"的双组分模型去描述:
符号含义
λC = 247.8561 nm,λFe = 247.976 nm
Ac:中心"碳相关复合面积";Af:Fe I 右肩面积
δ:两峰共享的局部剩余波长偏移;wc、wf:两组分 FWHM
b₀ + b₁(λ−λC):一次局部背景项,吸收基线校正后的微小残余
注意 Ac 和 Af 是拟合出来的"复合面积",并不等于恢复出来的纯 C I 或纯 Fe I 物理强度——这一点在解释结果时很关键。对照模型 M0 只含中心峰、不含铁右肩,用来验证铁肩是否必要。
3.5 用参考线约束分解:软约束
直接参考线的用法是:先用参考线预测右肩面积 Af,再把它作为"软约束"塞进分解。预测用简单的线性关系:
为避免"自己预测自己",对样品 i 估计 Âf,i 时只用其余样品拟合 p₀、p₁(交叉拟合)。然后把预测值作为先验,加进最小二乘目标函数:
第一项是常规的谱形重建,第二项是"惩罚项"——当 Af 偏离参考线预测的 Âf 时拉回一点。σAf 表示先验的不确定度,控制这个约束有多"硬"。
3.6 分层关联:样品间 vs 样品内
一条参考特征到底能不能用,不能只看总体相关,还要区分两种不同来源的共变。样品间模型用样品均值:
样品内模型先对每个样品中心化,再看同一样品不同采样点的同步波动:
βB 描述"不同样品平均水平之间的关系",βW 描述"同一样品内采样点的同步变化"。这个拆分的意义在于:一条线即使在样品间相关很好,如果样品内的点对点共波动不稳定,它的参考价值也存疑。
四、项目实际数据:这套理论落地后发生了什么
4.1 数据与验证方式
项目用了 154 条校正后的 LIBS 光谱,嵌套在 16 个独立土壤样品(3 个地区)里,碳浓度为 TC_percent。关键的一点是:154 条光谱是技术重复,独立统计单位只有 16 个样品,所以验证用的是"留一样品出"(LOSO)交叉验证,而不是把 154 条光谱当独立样本随机拆分。
4.2 第一步:双组分模型成立
首先确认式 (5) 的 M1 模型是否必要。结果是在全部 16 个样品的均值谱上,M1(中心峰 + 铁右肩)都得到强烈支持(16/16),说明 Fe I 247.976 nm 右肩确实是目标谱形不可或缺的一部分。这为后续提取 Ac 和 Af 提供了依据。
4.3 第二步:直接参考线失败了
最出人意料的结果来自对历史 Fe I 248.33 nm 参考线的检验——这正是 Bai 等(2016)在粉煤灰里效果最好的那条线。在土壤数据上,它的表现是:
| 检验 | 结果 |
|---|---|
| LOSO RMSE 变化 | −2.09%(几乎没有改善,甚至略差) |
| bootstrap 斜率区间 | 跨过零(符号不稳定) |
| 地区依赖 | 不同地区斜率方向不一致 |
| 软约束增量 | 仅 0.05–0.07% |
也就是说,式 (6)(7) 那条"用 Fe I 248.33 直接预测铁肩"的链路在土壤里不成立。这直接印证了式 (1) 的理论比率需要被经验系数取代、而经验系数又随基体变化的现实——粉煤灰里好用的线,换到土壤里就不灵了。
4.4 第三步:一条经验特征反而有效
反过来,一条在 251.923 nm 处拟合出来的"Fe 相关经验特征"(历史标签 251.9048 nm,与 NIST Fe II 251.90469 nm 相差 0.018 nm,故按经验复合特征处理)作为碳校准的协变量时,效果显著。碳校准用样品级聚合的线性模型:
全队列(FULL154)16 折 LOSO 的结果:
| 模型 | LOSO RMSE | MAE | Bias | R² |
|---|---|---|---|---|
| C0(仅 Ac) | 0.9117 | 0.5724 | 0.1787 | 0.4866 |
| C1(+ 251.923 特征) | 0.4744 | 0.2671 | 0.0857 | 0.8610 |
加入这条经验特征后,RMSE 下降了 47.96%,且通过了全部 8 项预注册的稳健性门槛(方向稳定、逐样品删除稳定、逐地区留出稳定等)。
4.5 但改善是"样品依赖"的
然而更严格的检验揭示了这个改善的脆弱性。在冻结验证分支(11 个开发样品 + 5 个来自新地区的冻结外部样品)里:
| 分支 | 基线 RMSE | 加特征 RMSE | 改善 |
|---|---|---|---|
| 开发集 LOSO | 0.4685 | 0.3597 | 23.22% |
| 冻结外部 5 样品 | 0.5439 | 0.2981 | 45.19% |
表面看外部改善很漂亮,但深挖下去问题浮现:
- 外部的"改善"本质是把基线 +0.52 wt.% 的正偏差,翻转成了 −0.26 wt.% 的负偏差(低估),外部的描述性 R² = −0.76,说明预测值和实测碳之间几乎没有正相关;
- 开发集的改善高度依赖一个化学极端样品(样品 05:最低碳 0.88%、最高铁 33.2 g/kg)——剔除这个样品后,改善从 23.22% 骤降到 5.89%;
- 没有任何一个冻结参考模型通过全部稳定性门槛。
五、结论与启示
把公式链和实际数据放在一起,参考线理论在这个项目里的结论可以归纳为三点:
- 物理根基成立,但理论比率不可直接迁移——式 (1) 的玻尔兹曼强度比解释了"为什么能用参考线",但土壤基体、等离子体温度、电离平衡、仪器响应和自吸收会让实际系数偏离理论值,所以必须用经验系数,而经验系数是基体依赖的。
- 直接参考先验在土壤里失效——Bai 等(2016)在粉煤灰里最佳的 Fe 248.33 nm 线,换到土壤就通不过检验(−2.09%、斜率跨零、地区依赖)。这说明参考线校正必须按样品群体重新验证。
- 经验特征有统计价值,但不是普适的物理扣除——251.923 nm 特征在全队列和冻结外部都降低了 RMSE,但改善是单样品敏感的、外部是偏差补偿而非预测相关。它的定位应是"经验协变量",用来做低碳/高铁区域的偏差调整,而不是一个通用的铁干扰物理扣除。
方法论层面,这个项目最有价值的产出可能不是某条具体的参考线,而是一套评价参考线校正的框架:物理合理性(元素、电离态、能级关系)、样品内同步共波动、样品级外部预测、单样品影响分析、预注册门槛和冻结外部验证,几类证据缺一不可。