2026年9月21日1402 字5 分钟最优化方法 Cheat Sheet文章介绍了优化的基本概念,即通过数学建模求最优解,并指出课程聚焦凸优化,因其理论成熟、算法高效且能指导非凸问题。文章分类讨论了连续与离散、无约束与约束、确定性与随机、凸与非凸优化问题,并阐述凸集、凸函数及凸优化问题的定义,强调凸优化的局部最优即全局最优,最后简述非凸优化的局部与全局求解思路。more...
2026年9月17日5219 字18 分钟试验设计 Cheat Sheet文章介绍了试验设计的基本概念、策略与原则,并系统讲解单因子方差分析。内容涵盖试验设计与抽样调查的区别、析因与分式析因等常见策略、随机化重复区组化三原则及七步设计准则,还梳理了试验设计简史,并详细推导固定效应模型的平方和分解、F检验、参数估计、残差诊断与均值比较方法。more...
2026年9月17日1107 字4 分钟多元统计分析 Cheat Sheet文章介绍了多元统计分析的基础概念与预备知识,包括多元数据、多元分析、多元正态分布假设及样本量要求,并说明多元统计方法涵盖可视化、检验、约减、预测和分组等。文中还给出数据矩阵与常用符号约定,介绍边际分布、散点图、雷达图等可视化方法,以及统计距离和标准化思路。预备知识部分补充了向量与矩阵代数、二次型、矩阵不等式、分块矩阵、随机向量与矩阵等内容。more...
2026年9月17日1368 字5 分钟线性模型 Cheat Sheet文章从一般统计模型出发,引出线性模型及其正态误差假设,随后系统回顾矩阵代数与随机向量等前置知识。矩阵部分涵盖迹与特征值、对称矩阵、半正定矩阵、列空间、奇异值分解、幂等与投影矩阵、向量微分及广义逆;随机向量部分介绍期望矩阵、协方差矩阵、奇异随机向量和线性投影,为后续线性回归理论奠定基础。more...
2026年9月26日5118 字18 分钟深度学习方法 Ch.17 CNN、ViT与目标检测文章在回顾卷积神经网络基本原理的基础上,拓展了计算机视觉的进阶内容,涵盖典型CNN(VGGNet、GoogLeNet)、视觉Transformer(ViT及其变体Swin Transformer、PVT)、目标检测模型(从R-CNN到DETR、DINO)以及MS COCO、PANDA等数据集与IoU、AP等评估指标,重点梳理了CNN、ViT与目标检测的技术演进脉络。more...
2026年9月22日2469 字9 分钟深度学习方法 Ch.16 多隐层神经网络本文系统介绍了多隐藏层神经网络(深度学习)的核心概念与训练方法。文章首先解释了深度网络相比单隐层网络的优势在于表达效率更高,随后详细补充了训练技巧,包括激活函数选择、参数初始化、自适应学习率算法(如AdaDelta和Nesterov加速法)、梯度截断、小批量梯度下降、权重衰减及数据增强。接着,文章探讨了调参策略,强调学习率的重要性,并介绍了正交化调参、误差分析(区分偏差与方差)及迁移学习等实用方法,为深度学习实践提供了系统性指导。more...
2026年9月3日4164 字14 分钟CS61B CHAPTER 7本文深入探讨了Java面向对象编程中的继承机制,从接口定义与实现出发,介绍了接口继承、抽象数据类型(ADT)及迭代器的实现方法。文章还详细讲解了对象方法(toString与equals)的覆写技巧,以及通过Comparable和Comparator接口实现多态性比较的方式。最后,阐述了泛化函数的定义与使用,展示了如何编写适用于任意类型的通用方法,为读者提供了系统的Java进阶知识梳理。more...
2026年9月1日3477 字12 分钟自然语言处理 Ch.10 机器翻译本文介绍了自然语言处理中的机器翻译技术,涵盖语言类型学差异、编码器-解码器架构、Transformer模型、解码方法及评估指标。机器翻译主要处理日常信息,采用序列到序列模型,通过交叉注意力机制实现源语言到目标语言的转换。解码方法包括束搜索和最小贝叶斯风险解码,评估指标则有chrF、BLEU和基于嵌入的方法。文章还探讨了不同语言在语序、词汇语义和省略倾向上的差异对翻译的影响。more...
2026年8月31日3823 字13 分钟自然语言处理 Ch.9 IR与RAG本文介绍了自然语言处理中信息检索(IR)与检索增强生成(RAG)的应用。RAG通过外部知识库解决大语言模型的幻觉、专有数据不可查及信息时效性问题,其核心是先用IR技术检索相关文档,再让LLM据此生成答案。IR部分详述了稀疏检索(基于tf-idf和BM25)与稠密检索(基于双编码器如ColBERT)的原理、评估指标(如准确率-召回率曲线、MAP),以及倒排索引等关键技术。RAG系统由检索器和生成器组成,可扩展重排序或智能体,评估常用精确匹配或F1分数。more...
2026年8月30日2656 字9 分钟自然语言处理 Ch.8 BERT本文介绍了双向Transformer编码器架构,重点讲解BERT模型家族。该架构采用掩码语言建模(MLM),通过预测被遮蔽词元进行预训练,与因果语言模型不同,它不生成文本,而是用于分类等任务。文章梳理了仅编码器、仅解码器和编码器-解码器三种架构,详述了BERT的训练过程(包括MLM和下一句预测)及微调方法,涵盖序列分类、序列对分类和序列标注等下游应用。more...
2026年8月19日9597 字32 分钟自然语言处理 Ch.7 Transformer与LLM本文系统介绍了大语言模型(LLM)的核心概念、Transformer架构及其训练与推理过程。内容涵盖LLM的定义与缩放定律、提示词机制、语言结构与可解释性,以及预训练、指令微调、偏好对齐和强化学习等训练阶段。文章深入剖析了Transformer的注意力机制、多头注意力、Transformer块组成、位置嵌入及解码方法,并讨论了参数高效微调(如LoRA)和KV缓存等优化技术,为理解现代NLP技术提供了全面基础。more...
2026年8月12日6556 字22 分钟机器学习方法 Ch.15 概率模型估计方法本文介绍了含有隐变量的概率模型估计方法,涵盖EM算法、变分推理和马尔可夫链蒙特卡罗法。EM算法通过迭代最大化Q函数估计参数,适用于GMM等模型;变分推理利用ELBO近似后验分布,适合复杂模型;MCMC通过随机抽样逼近目标分布,包括Metropolis-Hastings算法和吉布斯抽样。文章还总结了各方法在收敛性、速度和适用场景上的差异。more...
2026年8月10日1581 字6 分钟自然语言处理 Ch.6 序列标注本文介绍了自然语言处理中的序列标注方法,涵盖词性标注、命名实体识别和语义角色标注等任务,并指出其目标是提取事件以实现语义理解。文章重点阐述了词性标注的基线模型及改进方法,包括基于词的朴素贝叶斯和逻辑斯蒂回归,以及基于序列的隐马尔可夫模型和条件随机场;同时详述了命名实体识别的流程,如特征提取和BIO标签体系。最后,作者提到课程内容偏传统,计划后续补充神经网络相关内容。more...
2026年8月6日3077 字11 分钟自然语言处理 Ch.5 词嵌入本文介绍了词嵌入的核心概念与现代方法。首先从词袋模型的稀疏性问题出发,引出语义分析(如同义、多义、情感维度)及分布式假设,并介绍了共现矩阵及其加权形式(如PPMI)。随后重点讲解了Word2Vec的两种架构(CBOW与Skip-gram),包括其数学原理、梯度推导及负采样优化,并简要提及GloVe和FastText的改进思路。最后讨论了词嵌入的内部与外部评估方法。more...