监督学习假设输入与输出的随机变量X和Y遵循联合概率分布P(X,Y)
AI时代,有人焦虑失业,有人偷偷变强,不写代码不烧脑~
感受一句话的力量
AI时代,有人焦虑失业,有人偷偷变强,不写代码不烧脑~
监督学习假设输入与输出的随机变量X和Y遵循联合概率分布P(X,Y)
统计学习(statisticallearning)是关于计算机基于数据构建概率统计模型并运用模型对数据进行预测与分析的一门学科
正则化项一般是模型复杂度的单调递增函数,模型越复杂,正则化值就越大
在线学习可以是监督学习,也可以是无监督学习,强化学习本身就拥有在线学习的特点。
信息增益(informationgain)表示得知特征X的信息而使得类Y的信息的不确定性减少的程度。
分类问题、标注问题和回归问题。
本书介绍的核函数支持向量机,以及核PCA、核k均值属于核方法。
这是理论上模型f(X)关于联合分布P(X,Y)的平均意义下的损失,称为风险函数(riskfunction)或期望损失(expectedloss)。
参数向量θ取值于n维欧氏空间Rn,称为参数空间(parameterspace)。
隐马尔可夫模型(hiddenMarkovmodel,HMM)是可用于标注问题的统计学习模型,描述由隐藏的马尔可夫链随机生成观测序列的过程,属于生成模型
判别方法由数据直接学习决策函数f(X)或者条件概率分布P(Y|X)作为预测的模型,即判别模型。
损失函数是f(X)和Y的非负实值函数,记作L(Y,f(X))。
统计学习方法都是由模型、策略和算法构成的
计算机科学由三维组成:系统、计算、信息。
提升方法就是从弱学习算法出发,反复学习,得到一系列弱分类器(又称为基本分类器),然后组合这些弱分类器,构成一个强分类器
算法2.1(感知机学习算法的原始形式)
样本之间的相似度也可以用夹角余弦(cosine)来表示。夹角余弦越接近于1,表示样本越相似;越接近于0,表示样本越不相似。
通常特征选择的准则是信息增益或信息增益比。
感知机(perceptron)是二类分类的线性分类模型,其输入为实例的特征向量,输出为实例的类别,取+1和−1二值。
k值的选择、距离度量及分类决策规则是k近邻法的三个基本要素