大模型 | Transformer自然语言处理实战：使用Hugging-Face-Transformers库构建NLP应用（附：547页PDF）

6.1 CNN/DailyMail数据集6.2 文本摘要pipeline6.3 比较不同的摘要6.4 度量生成文本的质量6.5 在CNN/DailyMail数据集上评估PEGASUS6.6 训练摘要模型6.7 本章小结。

安卓老猴子

697人浏览 · 2025-03-18 16:08:12

安卓老猴子 · 2025-03-18 16:08:12 发布

自2017年问世以来，Transformer模型在众多自然语言处理（NLP）任务中取得了突破性进展，成为业界的主流技术。

这里给大家推荐一本《Transformer自然语言处理实战：使用Hugging-Face-Transformers库构建NLP应用》书籍。

在这里插入图片描述

本书涵盖了Transformer在NLP领域的主要应用。

首先介绍Transformer模型和Hugging Face 生态系统。然后重点介绍情感分析任务以及Trainer API、Transformer的架构，并讲述了在多语言中识别文本内实体的任务，以及Transformer模型生成文本的能力，还介绍了解码策略和度量指标。接着深入挖掘了文本摘要这个复杂的序列到序列的任务，并介绍了用于此任务的度量指标。

之后聚焦于构建基于评论的问答系统，介绍如何基于Haystack进行信息检索，探讨在缺乏大量标注数据的情况下提高模型性能的方法。

最后展示如何从头开始构建和训练用于自动填充Python源代码的模型，并总结Transformer面临的挑战以及将这个模型应用于其他领域的一些新研究。

有需要这本《Transformer自然语言处理实战》书籍PDF文档，可以微信扫描下方CSDN官方认证二维码，免费领取【保证100%免费】

第1章欢迎来到Transformer的世界

1.1 编码器-解码器框架
1.2 注意力机制
1.3 NLP的迁移学习
1.4 Hugging FaceTransformers库：提供规范化接口
1.5 Transformer应用概览
1.6 Hugging Face生态系统
1.7 Transformer的主要挑战
1.8 本章小结

第2章文本分类

2.1 数据集
2.2 将文本转换成词元
2.3 训练文本分类器
2.4 本章小结

第3章 Transformer架构剖析

3.1 Transformer架构
3.2 编码器
3.3 解码器
3.4 认识Transformer
3.5本章小结

第4章多语言命名实体识别

4.1 数据集
4.2 多语言Transformer
4.3 多语言词元化技术
4.4 命名实体识别中的Transformers
4.5 自定义Hugging Face Transformers库模型类
4.6 NER的词元化
4.7 性能度量
4.8 微调XLM-RoBERTa
4.9 错误分析
4.10 跨语言迁移
4.11 用模型小部件进行交互
4.12 本章小结

第5章文本生成

5.1 生成连贯文本的挑战
5.2 贪婪搜索解码
5.3 束搜索解码
5.4 采样方法
5.5 top-k和核采样
5.6 哪种解码方法最好
5.7 本章小结

第6章文本摘要

6.1 CNN/DailyMail数据集
6.2 文本摘要pipeline
6.3 比较不同的摘要
6.4 度量生成文本的质量
6.5 在CNN/DailyMail数据集上评估PEGASUS
6.6 训练摘要模型
6.7 本章小结

第7章构建问答系统

7.1 构建基于评论的问答系统
7.2 评估并改进问答pipeline
7.3 生成式问答
7.4 本章小结

第8章 Transformer模型调优

8.1 以意图识别为例
8.2 创建性能基准
8.3 通过知识蒸馏减小模型大小
8.4 利用量化技术使模型运算更快
8.5 基准测试量化模型2
8.6 使用ONNX和ONNX Runtime进行推理优化
8.7 使用权重剪枝使模型更稀疏
8.8 本章小结

第9章零样本学习和少样本学习

9.1 构建GitHub issue标记任务
9.2 基线模型—朴素贝叶斯
9.3 零样本学习
9.4 少样本学习
9.5 利用无标注数据

第10章从零训练Transformer模型
10.1 如何寻找大型数据集
10.2 构建词元分析器
10.3 从零训练一个模型
10.4 结果与分析

第11章未来发展趋势

11.1 Transformer的扩展
11.2 其他应用领域3
11.3 多模态的Transformer
11.4 继续前行的建议

有需要这本《Transformer自然语言处理实战》书籍PDF文档，可以微信扫描下方CSDN官方认证二维码，免费领取【保证100%免费】

魔乐社区

魔乐社区（Modelers.cn) 是一个中立、公益的人工智能社区，提供人工智能工具、模型、数据的托管、展示与应用协同服务，为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作，由全产业链共同建设、共同运营、共同享有，推动国产AI生态繁荣发展。

更多推荐

全家桶集齐！Qwen3.5四款小模型上线魔乐社区，附昇腾全套实践教程

魔乐社区

Pont - 搭建前后端之桥：高效、灵活的接口管理工具

Pont 是一款强大的数据服务层解决方案，它能够帮助开发者快速搭建前后端之间的桥梁，实现接口的高效管理和代码自动生成。无论是新手还是有经验的开发者，都能通过 Pont 轻松处理接口文档、生成类型安全的 API 代码，从而显著提升开发效率。[![Pont 工具标志](https://raw.gitcode.com/gh_mirrors/po/pont/raw/3f1b7d4bbba3fd2dda

魔乐社区

如何快速上手 hvac：HashiCorp Vault Python 客户端零基础入门指南

**hvac** 是 HashiCorp Vault 的 Python 3.X 客户端库，专为开发者提供简单高效的 Vault 交互方式。无论你是需要管理密钥、配置身份验证，还是实现安全的秘密数据存储，hvac 都能帮助你轻松搞定 Vault 的各项操作。本文将带你零基础快速入门，从安装到基础操作，让你在几分钟内即可上手使用这个强大的工具。[![hvac 客户端 Logo](https://r