报告试读
机器学习岩性识别与测井曲线重构研究
报告编号: OGC-A-024 报告级别: A 级专题深度研究 研究方向: 数字油田与油气 AI 编制单位: 经纬智汇信息咨询有限公司(北京) 报告用途: 内部参考 编制日期: 2026 年 7 月
摘要
测井曲线是油气地层评价最直接、最连续、成本最可控的信息载体,而岩性识别与曲线重构则是测井解释的两项基石性任务。前者决定了储层是否被正确"看见",后者决定了在数据缺失或质量欠佳时能否"补全"地层的真实面貌。长期以来,这两项任务依赖专家经验与交会图等半定量方法,效率低、主观性强、跨井跨区难以复制。近十余年,机器学习尤其是深度学习的介入,使这两项任务从"经验驱动"逐步转向"数据驱动+物理约束"的新范式。
本报告以全时间轴视角,系统梳理机器学习岩性识别与测井曲线重构的技术原理、方法演进、前沿动态、专利布局、全球竞争格局、市场规模与产业趋势,并以定量指标(识别准确率、重构 R²/RMSE)与真实案例(如 FORCE 2020 国际岩性识别公开竞赛)佐证技术成熟度。研究发现:梯度提升树(XGBoost/LightGBM)在结构化测井数据的岩性分类上已达到 90%–95% 的准确率,成为工业界当前的"主力机型";序列模型(LSTM/GRU/Transformer)在曲线重构上普遍实现 R²>0.9 的合成精度;而以测井基础模型(Well-Log Foundation Model)为代表的大模型范式,正在打开"一次预训练、多任务微调"的新窗口。
竞争格局上,国际油服三巨头(SLB、Halliburton、Baker Hughes)以云平台+解释软件的一体化生态占据高端解释市场;中国以中石油、中石化为代表的国家队则依托海量自有井数据与"昆仑""化龙"等自研大模型加速追赶,形成"平台生态 vs 数据主权"的双轨竞争。市场层面,全球油气 AI/数字油田相关市场 2025 年规模约在 37.9 亿—76.4 亿美元区间(口径不同),年复合增长率约 13%–14%,测井智能解释是其中确定性最高的落地场景之一。
报告最后给出强决策导向的结论:建议以"XGBoost/LightGBM 为工业基线、深度序列模型为重构主力、基础模型为战略预研"的三层技术栈进行立项;选型上优先考虑数据主权可控、可解释性达标、可与地质先验融合的方案;投资上聚焦物理信息神经网络、域自适应迁移学习、测井大模型微调三大突破方向。
一、引言:为什么是岩性识别与曲线重构
1.1 两项任务的产业价值
在油气勘探开发链条中,测井(Well Logging)承担着"给地层做 CT"的职能。仪器沿井筒下放,连续记录岩石与流体对不同物理场(伽马射线、电场、声波、中子、密度等)的响应,形成一条条随深度变化的测井曲线。地质与油藏工程师据此判断:这段地层是砂岩、泥岩还是碳酸盐岩?是否含油气?孔隙度、渗透率、含水饱和度几何?
岩性识别回答"这是什么岩石"这一最基础的问题。岩性判断错误,后续的储层参数计算、有效厚度划分、甚至射孔完井方案都会连锁出错。测井曲线重构(也称曲线补全、合成、预测)则解决"数据不全怎么办"的问题——老井缺少现代曲线、仪器故障导致某段数据失真、成本约束下未测某些曲线,都需要用已有曲线推断缺失曲线。
这两项任务的共同特征是:数据丰富但标注昂贵、物理规律清晰但地质非线性极强、单井易做但跨井难泛化。这正是机器学习既有用武之地、又充满挑战的典型场景。
1.2 研究边界与报告结构
本报告聚焦"机器学习/深度学习方法在岩性识别与曲线重构中的应用",覆盖从传统统计方法到大模型的完整技术谱系;地域上采取全球视野,兼顾国际油服巨头与中国国家队;颗粒度上贯穿宏观(产业/政策)、中观(平台/厂商)、微观(算法/模型/工程)三个层次。
按"结论后置"原则,报告先铺陈原理、演进、前沿、专利、格局、市场、案例、瓶颈,最后在第十、十一章给出风险提示与决策建议。
二、技术原理与方法体系
2.1 测井曲线的物理意义与岩性响应机理
理解机器学习方法之前,必须先理解其"输入特征"的物理本质。常规测井曲线各自刻画岩石的不同属性,正是这些属性的组合构成了岩性的"指纹"。
表 2-1 常规测井曲线的物理意义与岩性响应
| 曲线 | 英文/代号 | 物理测量对象 | 岩性/储层指示意义 |
|---|---|---|---|
| 自然伽马 | GR (Gamma Ray) | 地层天然放射性(K、U、Th) | 高值指示泥质含量高(泥岩),低值指示纯砂岩/碳酸盐岩,是划分砂泥岩最核心曲线 |
| 自然电位 | SP (Spontaneous Potential) | 井筒与地层间自然电位差 | 渗透性砂岩偏移明显,泥岩为基线,用于识别渗透层与估算泥质含量 |
| 深/浅电阻率 | RT/RD/RS | 地层电阻率 | 含油气层高阻、含水层低阻,泥岩通常低阻,是油水识别关键 |
| 密度 | DEN/RHOB | 地层体积密度 | 与孔隙度负相关;煤层极低密度,硬石膏/致密灰岩高密度 |
| 中子 | CNL/NPHI | 含氢指数(近似孔隙度) | 与密度组合可识别气层(挖掘效应)、区分岩性 |
| 声波时差 | AC/DT | 纵波传播时差 | 反映孔隙度与岩石骨架,泥岩时差大、致密岩时差小 |
| 光电吸收截面 | PE (Pe) | 光电吸收截面指数 | 对岩性矿物极敏感:石英≈1.8、方解石≈5.1、白云石≈3.1,是岩性识别"利器" |
机器学习模型本质上是在学习这些曲线的联合分布与岩性标签之间的复杂非线性映射。人类专家用交会图(如 DEN-CNL 交会、Pe-DEN 交会)二维地读取这种关系,而机器学习则能在高维空间中自动挖掘专家难以直觉把握的组合规律。
2.2 岩性识别的方法演进谱系
岩性识别方法的演进大致经历了四个阶段,可视为一部"从人工规则到自动表征学习"的技术史。
(1)传统统计与图版方法(1960s–2000s)
最早的岩性识别依赖交会图版法——将两条或多条曲线绘制在二维/三维坐标中,通过预先标定的岩性区域进行归类。随后引入判别分析(Discriminant Analysis)、主成分分析(PCA) 与 聚类分析(K-means、层次聚类) 等多元统计方法,实现半自动分类。这类方法透明、可解释,但对复杂岩性、薄互层、非线性边界束手无策,且严重依赖专家参数标定。
(2)经典机器学习阶段(2000s–2015)
随着统计学习理论成熟,一批经典监督学习算法进入测井领域:
- 支持向量机(SVM):通过核函数将样本映射至高维空间寻找最优分类超平面,在小样本、非线性问题上表现稳健,曾是岩性分类的主流选择之一。
- 人工神经网络(ANN/BP 网络):早期浅层网络已用于岩性判别,但受限于数据量与算力,泛化能力有限。
- K 近邻(KNN)、朴素贝叶斯、决策树:作为基线方法广泛用于对比研究。
(3)集成学习主导阶段(2015–2020)
集成学习(Ensemble Learning)的崛起深刻改变了工业界的技术选型:
- 随机森林(Random Forest):通过 Bagging 集成大量决策树,抗过拟合、可输出特征重要性,成为测井岩性识别的"常青树"。
- 梯度提升树(GBDT / XGBoost / LightGBM / CatBoost):通过 Boosting 逐步拟合残差,在结构化表格数据上精度极高、训练高效。这是当前工业界岩性识别事实上的主力方法——2020 年 FORCE 岩性识别公开竞赛的获胜方案正是以梯度提升树为核心。
(4)深度学习与表征学习阶段(2018 至今)
深度学习将岩性识别从"手工特征+分类器"推向"端到端表征学习":
- 全连接深度网络(DNN):处理单深度点的多曲线特征向量。
- 卷积神经网络(CNN/1D-CNN):将测井曲线视为一维信号,卷积核自动提取局部形态特征(如尖峰、台阶、渐变),对薄层与边界识别有优势。
- 循环神经网络(RNN/LSTM/GRU):将测井曲线视为随深度演化的序列,显式建模深度方向上的上下文依赖,捕捉地层的连续性与旋回性。
- Transformer / 注意力机制:以自注意力建模长程深度依赖,克服 RNN 的长序列遗忘问题,是当前研究最活跃的方向。
- 半监督/自监督/无监督方法:针对标注稀缺问题,利用海量无标签测井数据做预训练或伪标签扩充。
表 2-2 岩性识别主流机器学习方法对比
| 方法类别 | 代表算法 | 典型准确率区间* | 可解释性 | 数据需求 | 工业成熟度 |
|---|---|---|---|---|---|
| 传统统计 | 交会图、判别分析 | 60%–75% | 高 | 低 | 成熟但被替代 |
| 经典机器学习 | SVM、KNN | 75%–85% | 中 | 中 | 成熟 |
| 集成学习 | RF、XGBoost、LightGBM | 85%–95% | 中(可输出特征重要性) | 中 | 工业主力 |
| 深度学习-空间 | 1D-CNN、DNN | 82%–92% | 低 | 高 | 快速上升 |
| 深度学习-序列 | LSTM/GRU、Transformer | 85%–93% | 低 | 高 | 研究前沿 |
| 大模型/基础模型 | 测井基础模型(预训练+微调) | 视任务而定 | 低 | 极高(预训练) | 战略预研 |
*注:准确率区间为综合多项公开研究与竞赛的经验范围,实际结果高度依赖数据集、岩性类别数、类别不平衡程度与评价口径,仅供横向参考。
2.3 测井曲线重构的方法体系
曲线重构的目标是:给定若干条已知曲线,预测(合成)一条或多条缺失/失真曲线。这本质上是一个回归或序列到序列生成问题。
(1)多元回归与经验公式:传统上用线性/非线性回归建立曲线间关系(如用声波、密度、电阻率合成缺失的中子曲线),简单但精度受限于线性假设。
(2)机器学习回归:随机森林回归、GBDT 回归可捕捉非线性关系,是当前重构的常用基线,在多数场景可达 R²>0.85。
(3)深度序列到序列模型:LSTM/GRU 编码-解码结构将已知曲线序列映射为目标曲线序列,显式利用深度上下文,重构精度普遍 R²>0.9。双向 LSTM(BiLSTM)进一步利用上下文双向信息提升平滑性与精度。
(4)生成对抗网络(GAN)合成曲线:以生成器合成逼真曲线、判别器辨别真伪,对抗训练使合成曲线在统计分布上更接近真实数据,尤其适合数据增强与极端缺失场景。
(5)物理信息神经网络(PINN):将岩石物理方程(如 Wyllie 时间平均方程、Archie 公式等)作为约束项嵌入损失函数,使模型输出既拟合数据又服从物理规律,显著提升外推能力与地质合理性——这是当前最受期待的突破方向之一。
表 2-3 测井曲线重构方法与典型精度
| 方法 | 建模思路 | 典型精度(R²) | 优势 | 局限 |
|---|---|---|---|---|
| 多元线性回归 | 曲线间线性映射 | 0.70–0.85 | 简单、可解释 | 无法拟合强非线性 |
| 随机森林/GBDT 回归 | 非线性表格回归 | 0.85–0.93 | 稳健、易部署 | 不显式利用深度序列 |
| LSTM/GRU seq2seq | 序列上下文建模 | 0.90–0.96 | 利用地层连续性 | 需较多数据、黑箱 |
| GAN 合成 | 对抗生成 | 视场景 | 分布逼真、可增强 | 训练不稳定 |
| PINN 物理约束 | 数据+物理双约束 | 提升外推可靠性 | 地质合理、抗外推失真 | 需构造合适物理约束 |
2.4 特征工程、数据预处理与关键难点
无论采用何种模型,"垃圾进、垃圾出"的铁律在测井 AI 中体现得淋漓尽致。核心工程环节包括:
- 深度对齐(Depth Matching):不同测井仪器、不同测井时间的曲线需按深度精确对齐,否则特征错位。
- 环境校正:井眼扩径、泥浆侵入、温度压力等会污染原始读数,需先做环境校正。
- 归一化/标准化:不同曲线量纲差异巨大(GR 数十到数百 API,电阻率跨数个数量级),需归一化并对电阻率等做对数变换。
- 异常值与缺失处理:剔除仪器故障、井壁垮塌造成的失真段。
- 类别不平衡处理:泥岩、砂岩样本远多于煤层、火成岩等稀有岩性,需过采样(SMOTE)、欠采样或加权损失。
- 小样本/标注稀缺:岩心标定的"真值"极其昂贵稀少,催生半监督、迁移学习、数据增强需求。
2.5 可解释性与不确定性量化
工业落地的一大障碍是深度模型的"黑箱"属性。为让地质专家信任模型输出,可解释 AI(XAI)方法被广泛引入:
- 特征重要性:随机森林/GBDT 天然可输出各曲线对预测的贡献度。
- SHAP 值(SHapley Additive exPlanations):基于博弈论量化每条曲线对单个预测的正负贡献,可视化"为什么模型判为砂岩"。
- 不确定性量化:贝叶斯神经网络、蒙特卡洛 Dropout、深度集成等方法输出预测置信度,帮助工程师识别"模型也没把握"的深度段,实现人机协同复核。

*图 2-1 岩性识别机器学习方法演进技术谱系图*
解锁本篇完整报告
报告编号 OGC-A-024
以上为免费试读。手机号注册即得 1 次免费阅读额度(用户名选填),可解锁本篇的深度剖析、情景推演与行动建议;加顾问企微再 +2 次。
注册 / 登录后免费解锁