Souyer's Blog

=Souyer的博客=

自然语言处理 Ch.3 n-gram语言模型

自然语言处理 Ch.3 n-gram语言模型

本文介绍了语言模型的基本概念与n-gram模型的核心原理。语言模型用于计算序列概率、判断语句合理性及预测下一个词,n-gram基于马尔可夫假设,仅依赖前n-1个词,涵盖一元、二元、三元模型及其参数估计方法。文章还讨论了模型评估指标困惑度,以及解决数据稀疏问题的平滑技术,包括拉普拉斯平滑、减值法和插值法,旨在提升模型对未见词组的处理能力。
more...
CS61B CHAPTER 6

CS61B CHAPTER 6

本文阐述了编程中测试代码的重要性,指出在LLM时代测试比调试更为关键。内容涵盖随机测试(Ad Hoc Testing)和基于Google Truth库的单元测试方法,通过字符串排序示例演示了如何编写测试类、使用断言检测代码输出与期望值的差异。随后详细实现了选择排序算法,包括寻找最小元素、交换位置和递归排序三个步骤,并强调综合运用测试与调试器能有效提升代码编写效率。
more...
机器学习方法 Ch.12 k近邻与聚类方法

机器学习方法 Ch.12 k近邻与聚类方法

本文介绍了无监督学习中的k近邻算法与多种聚类方法。k近邻法通过寻找训练集中最近的k个实例进行分类或回归,其模型由距离度量、k值选择和决策规则决定,并可用k-d树加速搜索。聚类部分涵盖层次聚类、k均值聚类及DBSCAN算法,阐述了各类算法的原理、复杂度、优缺点,并介绍了轮廓系数、Calinski-Harabasz指数和DB指数等内部评价指标。
more...
机器学习方法 Ch.11 条件随机场

机器学习方法 Ch.11 条件随机场

本文介绍了条件随机场(CRF)这一概率无向图模型。首先阐述了概率无向图模型(马尔可夫随机场)的基本概念,包括成对、局部和全局马尔可夫性,以及通过最大团进行因子分解的方法。随后重点讲解了线性链条件随机场,其适用于序列标注任务,具有基本、一般和矩阵三种形式,并介绍了概率计算的前向-后向算法、参数学习的极大似然估计法以及预测用的维特比算法。最后,文章对比了HMM与CRF的发展脉络,并总结了监督学习方法。
more...
CS61B CHAPTER 5

CS61B CHAPTER 5

本文介绍了从单向链表SLList到双向链表DLList的改进过程,通过增加前驱指针和哨兵节点优化了删除操作,并引入泛型支持多种数据类型。随后转向数组实现,构建了AList类,讨论了数组扩容策略(从线性到倍增)和负载率控制,最后提及通用数组和循环数组的概念,以提升列表操作的效率和灵活性。
more...
机器学习方法 Ch.10 隐马尔可夫模型

机器学习方法 Ch.10 隐马尔可夫模型

本文系统阐述了隐马尔可夫模型(HMM)的核心内容,涵盖基本概念、三大假设与三个基本问题,并详细介绍了前向-后向算法、Baum-Welch学习算法及预测算法(近似算法与维特比算法)。文章从概率图模型出发,定义了状态与观测集合、模型参数λ=(A,B,π),并通过动态规划思想将概率计算复杂度从指数级降至O(T·I²),同时给出监督与无监督学习方案,为序列标注等应用提供理论支撑。
more...
自然语言处理 Ch.2 文本预处理

自然语言处理 Ch.2 文本预处理

本文系统介绍了自然语言处理中的文本预处理技术,涵盖正则表达式匹配、文本词元化(含BPE算法与Unicode编码)、中文分词、词形归一化及最短编辑距离等核心内容。文章详细阐述了各技术的原理、实现方法及Python工具库应用,并通过大量代码示例和表格对比帮助理解,为后续文本分析与建模奠定基础。
more...
CS61B CHAPTER 4

CS61B CHAPTER 4

本文介绍了如何将递归结构的`IntList`改进为更安全高效的`SLList`类。通过五次迭代优化:首先封装递归结构,其次将`first`设为`private`防止外部破坏,接着将`IntNode`内嵌并添加`addLast`和`size`方法,然后引入缓存技术实时存储列表大小,最后采用哨兵节点统一处理空列表。最终形成一套完整的不变量规则,确保列表操作的安全性和效率。
more...
自然语言处理 Ch.1 Introduction

自然语言处理 Ch.1 Introduction

本文是自然语言处理(NLP)课程的入门笔记,系统介绍了NLP的基本概念、发展历程与技术架构。文章首先区分了自然语言与人工语言,阐明NLP旨在让计算机具备理解与生成语言的能力,并梳理了理性主义与经验主义两大方法论路线。随后回顾了从规则模型、统计模型到深度学习及大语言模型的发展脉络,最后总结了模型规模增长、训练方法创新、多模态发展及安全伦理关注等未来趋势。
more...
机器学习方法 Ch.9 LR与最大熵模型

机器学习方法 Ch.9 LR与最大熵模型

本文介绍了逻辑斯蒂回归与最大熵模型。逻辑斯蒂回归从二分类推广到多分类,基于Logistic分布建模条件概率,具有线性对数几率解释性,损失函数可统一为逻辑斯谛损失。最大熵模型依据最大熵原理,在特征期望约束下最大化条件熵,其学习过程转化为带约束优化,通过对偶问题求解,最终模型形式与逻辑斯蒂回归相似,同属对数线性模型,后者可视为前者的特例。
more...