2026年9月1日3477 字12 分钟自然语言处理 Ch.10 机器翻译本文介绍了自然语言处理中的机器翻译技术,涵盖语言类型学差异、编码器-解码器架构、Transformer模型、解码方法及评估指标。机器翻译主要处理日常信息,采用序列到序列模型,通过交叉注意力机制实现源语言到目标语言的转换。解码方法包括束搜索和最小贝叶斯风险解码,评估指标则有chrF、BLEU和基于嵌入的方法。文章还探讨了不同语言在语序、词汇语义和省略倾向上的差异对翻译的影响。more...
2026年8月31日3823 字13 分钟自然语言处理 Ch.9 IR与RAG本文介绍了自然语言处理中信息检索(IR)与检索增强生成(RAG)的应用。RAG通过外部知识库解决大语言模型的幻觉、专有数据不可查及信息时效性问题,其核心是先用IR技术检索相关文档,再让LLM据此生成答案。IR部分详述了稀疏检索(基于tf-idf和BM25)与稠密检索(基于双编码器如ColBERT)的原理、评估指标(如准确率-召回率曲线、MAP),以及倒排索引等关键技术。RAG系统由检索器和生成器组成,可扩展重排序或智能体,评估常用精确匹配或F1分数。more...
2026年8月30日2656 字9 分钟自然语言处理 Ch.8 BERT本文介绍了双向Transformer编码器架构,重点讲解BERT模型家族。该架构采用掩码语言建模(MLM),通过预测被遮蔽词元进行预训练,与因果语言模型不同,它不生成文本,而是用于分类等任务。文章梳理了仅编码器、仅解码器和编码器-解码器三种架构,详述了BERT的训练过程(包括MLM和下一句预测)及微调方法,涵盖序列分类、序列对分类和序列标注等下游应用。more...
2026年8月19日9597 字32 分钟自然语言处理 Ch.7 Transformer与LLM本文系统介绍了大语言模型(LLM)的核心概念、Transformer架构及其训练与推理过程。内容涵盖LLM的定义与缩放定律、提示词机制、语言结构与可解释性,以及预训练、指令微调、偏好对齐和强化学习等训练阶段。文章深入剖析了Transformer的注意力机制、多头注意力、Transformer块组成、位置嵌入及解码方法,并讨论了参数高效微调(如LoRA)和KV缓存等优化技术,为理解现代NLP技术提供了全面基础。more...
2026年8月12日6556 字22 分钟机器学习方法 Ch.15 概率模型估计方法本文介绍了含有隐变量的概率模型估计方法,涵盖EM算法、变分推理和马尔可夫链蒙特卡罗法。EM算法通过迭代最大化Q函数估计参数,适用于GMM等模型;变分推理利用ELBO近似后验分布,适合复杂模型;MCMC通过随机抽样逼近目标分布,包括Metropolis-Hastings算法和吉布斯抽样。文章还总结了各方法在收敛性、速度和适用场景上的差异。more...
2026年8月10日1581 字6 分钟自然语言处理 Ch.6 序列标注本文介绍了自然语言处理中的序列标注方法,涵盖词性标注、命名实体识别和语义角色标注等任务,并指出其目标是提取事件以实现语义理解。文章重点阐述了词性标注的基线模型及改进方法,包括基于词的朴素贝叶斯和逻辑斯蒂回归,以及基于序列的隐马尔可夫模型和条件随机场;同时详述了命名实体识别的流程,如特征提取和BIO标签体系。最后,作者提到课程内容偏传统,计划后续补充神经网络相关内容。more...
2026年8月6日3077 字11 分钟自然语言处理 Ch.5 词嵌入本文介绍了词嵌入的核心概念与现代方法。首先从词袋模型的稀疏性问题出发,引出语义分析(如同义、多义、情感维度)及分布式假设,并介绍了共现矩阵及其加权形式(如PPMI)。随后重点讲解了Word2Vec的两种架构(CBOW与Skip-gram),包括其数学原理、梯度推导及负采样优化,并简要提及GloVe和FastText的改进思路。最后讨论了词嵌入的内部与外部评估方法。more...
2026年8月6日2429 字9 分钟机器学习算法 Ch.14 潜在狄利克雷分配本文介绍了潜在狄利克雷分配(LDA)模型,一种基于贝叶斯框架的概率主题建模方法。与PLSA将参数视为固定常数不同,LDA将参数视为随机变量,引入狄利克雷先验分布,并通过数据修正得到后验分布,从而提升模型泛化能力。文章详细阐述了狄利克雷分布的定义、性质及其作为多项分布共轭先验的作用,并给出了LDA的生成过程、概率计算公式及两种近似学习算法:吉布斯抽样和变分EM算法,用于估计模型参数。more...
2026年8月5日1561 字6 分钟自然语言处理 Ch.4 文本分类本文介绍了文本分类的核心流程与评估方法。文本分类应用广泛,早期依赖规则系统但成本高、难推广,现多借助机器学习方法。其关键步骤是将预处理后的文本通过词袋模型转化为向量表示,并利用文档频率、互信息、信息增益或卡方统计量进行特征选择以降低维度。分类评估方面,文章详细推导了交叉熵损失函数,并补充了精确率、召回率及F值等指标,同时针对多分类问题介绍了宏平均与微平均两种策略,其中宏平均更关注低频类别表现。more...
2026年7月31日3410 字12 分钟机器学习方法 Ch.13 潜在语义分析本文系统介绍了话题分析的基本概念与方法,核心思想是用单词分布表示话题、话题分布表示文本。内容涵盖三大模型:潜在语义分析(LSA)通过单词-文本矩阵的奇异值分解实现降维,并引入非负矩阵分解(NMF)增强可解释性;概率潜在语义分析(PLSA)采用概率生成模型,通过EM算法估计参数;潜在狄利克雷分配(LDA)作为概率模型的代表也被提及。文章详细阐述了各模型的数学原理、算法推导及优缺点,为文本语义分析提供了完整的理论框架。more...