论文

BERT

BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding · NAACL 2019 · arXiv:1810.04805

BERT 是一篇帮助 AI 更好理解一句话前后含义的经典研究。想读原文或正式引用时,优先选择 ACL 出版版本。

已核验论文 · ACL / NAACL 2019 · 资料更新 2026-07-21
为什么重要
经典语言理解研究影响后续模型与任务方法
正式出版
ACL / NAACL 2019需要引用时优先使用
原文入口
ACL Anthology · arXiv本站只做导读与链接

三分钟读懂 BERT

这是 OKNP 的独立导读,不是论文摘要的翻译、近似改写或全文替代。

OKNP 解读

BERT 把双向上下文表示与通用预训练—任务微调路径组合成一个清晰、可迁移的研究方案。

它适合用来理解“同一预训练表示如何服务多个下游任务”,也适合练习区分历史影响与今天仍成立的技术边界。

本页文字是 OKNP 独立解读,不复制 ACL 或 arXiv 的完整摘要,也不替代原论文。

01

OKNP 解读

研究问题

怎样得到能同时利用左右上下文、又容易适配多种语言任务的表示?
02

OKNP 解读

核心想法

先以双向上下文目标预训练 Transformer 编码器,再用较小的任务头完成下游微调。
03

编辑定位

相对前作改变

把深层双向表示和统一微调路径放到同一套可复用训练框架中。
04

作者主张

论文结果

作者报告该方法在多项自然语言理解任务上取得当时有竞争力的结果;具体数字请回原文表格核对。

方法怎么走

下方示意只表达方法事实,不复制论文原图、图注或版式。

  1. 01

    输入表示

    把 token、句段与位置等信息组织为编码器输入。

  2. 02

    双向编码

    Transformer 编码器同时建模左右上下文。

  3. 03

    预训练任务

    以 masked language modeling 为主,并在原论文方案中加入 next sentence prediction。

  4. 04

    任务微调

    复用预训练参数,只增加轻量任务结构并联合微调。

  5. 05

    下游任务

    覆盖句子级与 token 级自然语言理解任务。

方法路径:输入表示 → 双向编码 → 两项预训练任务 → 任务微调 → 多类下游任务。

证据支持什么,也不支持什么

任务、指标和作者主张一一对应;历史影响不等于今天的模型排名。

  1. 实验 01

    GLUE

    任务
    多任务语言理解
    指标
    任务集合指标
    比较
    与论文列出的当时基线比较
    支持的作者主张
    统一微调路径可迁移到多个句子级任务
    原文位置
    ACL 正式版实验章节 / 表 1
  2. 实验 02

    SQuAD

    任务
    抽取式问答
    指标
    EM / F1
    比较
    与论文列出的问答系统比较
    支持的作者主张
    双向表示可适配 span prediction
    原文位置
    ACL 正式版实验章节 / 表 2
  3. 实验 03

    SWAG

    任务
    常识推理
    指标
    Accuracy
    比较
    与论文列出的当时基线比较
    支持的作者主张
    同一表示可迁移到多选推理任务
    原文位置
    ACL 正式版实验章节 / 表 3

作者方案边界

页面只把 MLM / NSP 记为这篇论文的具体训练设计,不把它们写成所有后续语言模型的必要条件。

今天的阅读边界

待核验适用于 后续研究与第三方证据

训练成本、语料偏差与跨语言适用性需要结合后续研究另行判断;本站尚未收录完整第三方证据。

历史影响不等于现行最佳

本站说明

BERT 的历史位置与任何今天的模型排名是两件事;本站不把引用或影响转成综合质量分。

读哪个版本,怎么引用

同一研究成果可能有预印本和正式出版版本;阅读与引用时要分清版本。

同一研究成果同一研究成果:BERT

这里汇总各版本的日期、标识符、出版状态与许可。

推荐引用
ACL 正式版
作者
Jacob Devlin · Ming-Wei Chang · Kenton Lee · Kristina Toutanova
机构来源
Google Research(机构侧收录)
正式出版
NAACL 2019
arXiv 记录 DOI
10.48550/arXiv.1810.04805
  1. 版本 01

    预印本

    arXiv v1

    arXiv ID
    1810.04805v1
    发布平台
    arXiv
    许可
    逐版本许可;需在该版本页面核验
    获取
    免费查看 / 下载
    转载边界
    链接与免费访问不等于第三方转载权
    打开该版本记录(在新标签页打开)
  2. 版本 02

    修订预印本

    arXiv v2

    arXiv ID
    1810.04805v2
    发布平台
    arXiv
    许可
    逐版本许可;需在该版本页面核验
    获取
    免费查看 / 下载
    转载边界
    链接与免费访问不等于第三方转载权
    打开该版本记录(在新标签页打开)
查看推荐引用与内容使用边界
内容边界

链接不等于转载权

  • 本站不逐字复制完整摘要;请在 ACL 或 arXiv 原始页面阅读。
  • 不托管、不代理、不重排 PDF / HTML 全文。
  • 不复制论文原图表;方法路径由 OKNP 以事实结构重新绘制。
  • 存在链接、DOI 或开放获取标记,不等于已获得转载权。

如何复现,影响到哪里

代码、数据、论文许可和维护状态分别判断;影响关系放回百科网络。

放回百科关系网

建立表示路径BERT 模型谱系模型
继承架构基础Transformer 研究脉络论文
由机构作者页收录Google Research研究机构
资料来源BERT 版本来源查看原始来源与核验口径 · 按需展开

本站链接原始记录,不托管论文 PDF;开放获取也不自动授予第三方材料转载权。

  1. ACL Anthology — BERT已核验

    出版方记录 · 适用于 BERT 正式出版版本与 DOI

    资料日 2019 · 核验 2026-07-21

    打开原始来源(在新标签页打开)
  2. arXiv — BERT已核验

    代码仓库 · 适用于 BERT arXiv v1 / v2 预印本版本记录

    资料日 2018-10-11—2019-05-24 · 核验 2026-07-21

    打开原始来源(在新标签页打开)
  3. Google Research — BERT已核验

    作者机构页 · 适用于 作者、机构摘要与 BibTeX 入口

    资料日 2018 · 核验 2026-07-21

    打开原始来源(在新标签页打开)
  4. Crossref — N19-1423已核验

    引用元数据提供方 · 适用于 出版 DOI 10.18653/v1/N19-1423 的 Crossref 引用关系

    资料日 2026-07-21 · 核验 2026-07-21

    打开原始来源(在新标签页打开)
  5. arXiv License Information已核验

    代码仓库政策 · 适用于 arXiv 免费访问与逐版本许可边界

    资料日 未标注(2026-07-21) · 核验 2026-07-21

    打开原始来源(在新标签页打开)