标签:ai
共 26 篇文章:
- 生成式AI导论:从“文字接龙”说起 — LLM(大型语言模型,如 ChatGPT、Gemini、Claude、DeepSeek 等)的核心机制其实非常简单——就是文字接龙。
- DESCAN — DBSCAN(Density-Based Spatial Clustering of Applications with Noise)是一种密度聚类算法,它基于数据点的密度来发现任意形状的簇,并能够识别噪声数据点。DBSCAN 将密度定义为某个点周围的邻域内的?
- 数据降维 — 数据降维是指通过保留数据集中最重要的特征信息,将数据从高维空间转换为低维空间的过程。数据降维旨在减少数据集的维度,同时尽可能地保留原始数据的信息,以便于可视化、压缩和加速机器学习算法的训练和预测。
- 极限森林 — 极限森林(Extremely Randomized Trees),也称为Extra-Trees,是一种集成学习方法,类似于随机森林。它在随机森林的基础上做了一些改进,以进一步增加模型的随机性。
- K-means — K-means 聚类算法是一种常用的基于距离的无监督学习算法,用于将数据集分成 K 个不同的簇。它试图通过最小化数据点与所属簇中心的距离来划分数据,使得每个数据点都属于与其最近的簇。
- Lasso回归 — 套索回归(Lasso Regression,全称为Least Absolute Shrinkage and Selection Operator回归)是一种线性模型的正则化方法,用于估计回归模型的系数。它是Ridge回归的一个扩展,同样旨在解决多重共线性问题、?
- 弹性网络回归 — 弹性网络回归(Elastic Net Regression)是一种结合了岭回归(Ridge Regression)和Lasso回归(Lasso Regression)的线性回归模型,旨在克服它们各自的一些缺点,并同时利用它们的优点。
- 数据归一化 — 数据归一化(Normalization 或 Scaling)是一种数据预处理技术,旨在调整数据的尺度,使得不同特征之间具有可比性,或者满足特定算法的输入要求。这一过程对于数据分析、机器学习模型的训练尤为重要,因为它可以带来以下好处:
- 正则化方法 — 正则化方法是一种在机器学习和统计建模中广泛采用的技术,旨在解决模型过拟合问题,提高模型的泛化能力。过拟合指的是模型在训练数据上表现得过于优秀,以至于它学习到了训练数据中的噪声和偶然特征,而不能很好地泛化到未见过的新数据上。其本质是减小w的值来干扰数据的扰动,
- 代价函数 — 代价函数(Cost Function)是在机器学习和优化问题中使用的一个重要概念。它是一个衡量模型预测与实际观测之间差异的函数,通常用于评估模型的性能和指导参数优化的过程。
- 岭回归 — 岭回归(Ridge Regression)是一种处理多重共线性问题的线性模型正则化方法,与套索回归类似,但采用的是L2正则化,即模型系数平方和的惩罚项。岭回归通过在损失函数中加入正则项,来限制模型系数的大小,从而避免过拟合,提高模型的稳定性。与套索回归相比,岭?
- 支持向量回归(SVR) — 支持向量机(Support Vector Machine,SVM)是一种强大的监督学习算法,常用于分类和回归问题。它的主要思想是找到能够有效划分不同类别数据的超平面,并且使得超平面到最近的数据点(支持向量)的距离最大化。
- 正规方程及其推导 — 正规方程是用于解决线性回归问题的一种方法,它不需要迭代,直接通过该方法可以直接求解出最优的参数值。正规方程特别适用于小型数据集,因为对于大数据集,计算和存储完整的矩阵求逆可能会非常昂贵。下面简要介绍正规方程及其推导过程:
- [Hard sigmoid和soft sigmoid](/Ai/Hard sigmoid和soft sigmoid) — Hard sigmoid 和 soft sigmoid 是两种不同的激活函数,它们在神经网络中常被用作替代的激活函数。
- [Rectified Linear Unit](/Ai/Rectified Linear Unit) — Rectified Linear Unit (ReLU) 是一种常用的神经网络激活函数,它在深度学习中被广泛应用。
- 全连接前馈网络(FNN) — 全连接前馈网络(Fully Connected Feedforward Network)是一种基本的神经网络架构,也被称为多层感知机(Multilayer Perceptron,MLP)。它包含一个或多个隐藏层,每个隐藏层都由多个神经元组成,每个神经元与上一层?
- 决策树算法 — 决策树算法是一种流行的机器学习方法,既可以用于分类任务也可以用于回归任务。它通过从训练数据集中学习一系列规则来创建一个树状结构,这个结构能够对新数据进行预测。以下是决策树算法的一些核心概念和步骤:
- 梯度下降 — 梯度下降是一种优化算法,它通过迭代的方式逐步调整模型参数,以最小化损失函数活优化目标函数。
- 欠拟合和过拟合 — 欠拟合发生在模型过于简单,无法捕捉数据中的底层模式时。模型无法从训练数据中学习到足够的特征,导致在训练集上的表现不佳,同时在测试集上的表现也很差。这表明模型没有学到足够的信息去概括数据。
- 正向传播和反向传播 — 正向传播(Forward Propagation)和反向传播(Backpropagation)是深度学习中两个重要的概念,它们共同构成了神经网络的训练过程。正向传播求损失,反向传播回传误差。同时,神经网络每层的每个神经元都可以根据误差信号修正每层的权重。
- 深度神经网络 — 深度神经网络(Deep Neural Network,DNN)是一种由多个神经网络层组成的神经网络模型。与传统的浅层神经网络相比,深度神经网络具有更多的隐藏层,因此能够更有效地学习复杂的非线性关系和特征。
- 聚类算法 — 聚类算法是一类无监督学习方法,旨在将数据集中的数据点按照它们之间的相似性或距离自动分组成多个类别或簇(clusters),每个簇内的数据对象具有较高的相似性,而不同簇之间的数据对象差异较大。聚类算法不需要预先标记的数据集,即没有预设的类别标签,而是通过数据本身?
- 逻辑回归 — 逻辑回归(Logistic Regression)是一种用于解决分类问题的统计学习方法。尽管其名称中包含“回归”一词,但逻辑回归实际上是一种分类算法,常用于解决二分类问题,也可以扩展到多分类问题。
- 监督学习 — 回归算法用于预测连续型变量的数值,例如房价、温度、销售额等。它们建立了自变量(输入特征)和因变量(输出标签)之间的关系,并且尝试拟合一条最佳拟合线(或曲线),以最好地预测新的数据点。
- 多项式回归 — 多项式回归是一种非线性回归方法,它通过拟合数据与多项式函数的关系来建立模型。与线性回归不同,多项式回归的模型假设不再是线性的,而是一个多项式函数。
- 随机森林算法 — 随机森林(Random Forest)是一种集成学习方法,用于解决分类和回归问题。它通过构建多个决策树来完成任务,并通过投票(分类)或取平均值(回归)的方式来得到最终的预测结果。以下是随机森林的基本原理和特点:
