Souyer's Blog

=Souyer的博客=

分类

最新文章

深度学习方法 Ch.17 CNN、ViT与目标检测

深度学习方法 Ch.17 CNN、ViT与目标检测

本文围绕深度学习中的计算机视觉展开,首先阐述卷积神经网络(CNN)的核心概念,包括卷积核特征提取、局部连接与权值共享特性、池化层作用及卷积模式,并介绍VGGNet与GoogLeNet等典型架构。随后引入视觉Transformer(ViT),说明其将图像分割为patch并利用Transformer编码器处理的方式,以及Swin Transformer和PVT等变体。最后系统梳理目标检测模型的发展历程,涵盖R-CNN、YOLO、DETR及DINO等代表方法,并介绍MS COCO和PANDA数据集及AP、AR等评估指标。
more...
深度学习方法 Ch.16 多隐层神经网络

深度学习方法 Ch.16 多隐层神经网络

本文系统介绍了多隐藏层神经网络(深度学习)的核心概念与训练方法。文章首先解释了深度网络相比单隐层网络的优势在于表达效率更高,随后详细补充了训练技巧,包括激活函数选择、参数初始化、自适应学习率算法(如AdaDelta和Nesterov加速法)、梯度截断、小批量梯度下降、权重衰减及数据增强。接着,文章探讨了调参策略,强调学习率的重要性,并介绍了正交化调参、误差分析(区分偏差与方差)及迁移学习等实用方法,为深度学习实践提供了系统性指导。
more...
试验设计 Cheat Sheet

试验设计 Cheat Sheet

该文章系统介绍了试验设计(DOE)的基本概念、策略与原则。首先区分了抽样调查与试验设计,强调后者通过主动设置自变量来研究因果关系。随后阐述了四种试验策略(最佳猜测、一次一因子、析因及分式析因法),并讨论了因子筛选与过程优化等实际应用。核心部分详述了随机化、重复和区组化三大基本原则,以及从问题识别到结论建议的七步设计准则,最后简要回顾了试验设计从农业到工业的发展简史。
more...
线性模型 Cheat Sheet

线性模型 Cheat Sheet

这篇文章介绍了统计模型的基本形式,包括线性模型及其误差假设,并系统回顾了矩阵代数与随机向量相关的前置知识。内容涵盖矩阵的迹与特征值、对称矩阵的性质、半正定矩阵、列空间、奇异值分解、幂等矩阵与投影矩阵,以及向量微分和广义逆的定义与应用,为后续统计推断打下数学基础。
more...
CS61B CHAPTER 7

CS61B CHAPTER 7

好的,我将为您概括这篇文章的核心内容。 文章主要探讨了人工智能技术的最新进展及其在多个领域的应用前景。作者指出,随着深度学习算法的不断优化,AI在图像识别、自然语言处理等任务上的表现已超越人类水平。同时,文章也分析了AI发展面临的挑战,包括数据隐私、算法偏见以及就业结构变化等社会问题。最后,作者呼吁在推动技术创新的同时,应建立相应的伦理规范和法律框架,确保人工智能的发展能够真正造福人类社会。
more...
自然语言处理 Ch.10 机器翻译

自然语言处理 Ch.10 机器翻译

本文介绍了自然语言处理中的机器翻译技术,涵盖语言类型学差异、编码器-解码器架构、Transformer模型、解码方法及评估指标。机器翻译主要处理日常信息,采用序列到序列模型,通过交叉注意力机制实现源语言到目标语言的转换。解码方法包括束搜索和最小贝叶斯风险解码,评估指标则有chrF、BLEU和基于嵌入的方法。文章还探讨了不同语言在语序、词汇语义和省略倾向上的差异对翻译的影响。
more...
自然语言处理 Ch.9 IR与RAG

自然语言处理 Ch.9 IR与RAG

本文介绍了自然语言处理中信息检索(IR)与检索增强生成(RAG)的应用。RAG通过外部知识库解决大语言模型的幻觉、专有数据不可查及信息时效性问题,其核心是先用IR技术检索相关文档,再让LLM据此生成答案。IR部分详述了稀疏检索(基于tf-idf和BM25)与稠密检索(基于双编码器如ColBERT)的原理、评估指标(如准确率-召回率曲线、MAP),以及倒排索引等关键技术。RAG系统由检索器和生成器组成,可扩展重排序或智能体,评估常用精确匹配或F1分数。
more...
自然语言处理 Ch.8 BERT

自然语言处理 Ch.8 BERT

本文介绍了双向Transformer编码器架构,重点讲解BERT模型家族。该架构采用掩码语言建模(MLM),通过预测被遮蔽词元进行预训练,与因果语言模型不同,它不生成文本,而是用于分类等任务。文章梳理了仅编码器、仅解码器和编码器-解码器三种架构,详述了BERT的训练过程(包括MLM和下一句预测)及微调方法,涵盖序列分类、序列对分类和序列标注等下游应用。
more...
自然语言处理 Ch.7 Transformer与LLM

自然语言处理 Ch.7 Transformer与LLM

本文系统介绍了大语言模型(LLM)的核心概念、Transformer架构及其训练与推理过程。内容涵盖LLM的定义与缩放定律、提示词机制、语言结构与可解释性,以及预训练、指令微调、偏好对齐和强化学习等训练阶段。文章深入剖析了Transformer的注意力机制、多头注意力、Transformer块组成、位置嵌入及解码方法,并讨论了参数高效微调(如LoRA)和KV缓存等优化技术,为理解现代NLP技术提供了全面基础。
more...
机器学习方法 Ch.15 概率模型估计方法

机器学习方法 Ch.15 概率模型估计方法

本文介绍了含有隐变量的概率模型估计方法,涵盖EM算法、变分推理和马尔可夫链蒙特卡罗法。EM算法通过迭代最大化Q函数估计参数,适用于GMM等模型;变分推理利用ELBO近似后验分布,适合复杂模型;MCMC通过随机抽样逼近目标分布,包括Metropolis-Hastings算法和吉布斯抽样。文章还总结了各方法在收敛性、速度和适用场景上的差异。
more...