nn model

Intension:XOR is not linear-seperable

ML的本质都是分类,对线性不可分,一方面SVM映射到高维,
t a n h ( α ) = e x p ( α ) − e x p ( − α ) e x p ( α ) + e x p ( − α ) tanh(\alpha)=\frac{exp(\alpha)-exp(-\alpha)}{exp(\alpha)+exp(-\alpha)} tanh(α)=exp(α)+exp(−α)exp(α)−exp(−α),for easy normalization

梯度下降->Newton method

一阶导用于梯度下降,二阶导为动量,用于调整学习率

不同学习率调整方法的比较:

RMSProp对序列任务表现较为accurate;

Adam下降较快,测试效果较差;

  • n-元句子的概率计算公式? MLE for句子的最大似然概率
    P ( w 1 . . . w n ) ≈ ∏ i = 1 n P ( w i ∣ w i − 1 . . . w i − k ) P(w_1...w_n)\approx \prod_{i=1}^n P(w_i|w_{i-1}...w_{i-k}) P(w1...wn)≈∏i=1nP(wi∣wi−1...wi−k)
  • 学习方式:
  1. continuous bag of words
  2. skip-gram

?NN全参数可学习,

nn到语言模型的代入is simple,what's difficult?

  • Does Neural LM need smoothing?
    No,even if there are some variable is 0,the propagation proceeds successfully.
    for output random vector,which is unseen,can be expressed.
    But how does we predict from embedding vector to word.
  1. Linear+Softmax to one-hot vector to predict.
  • How does Neural LM capture long-term n-gram dependencies?

    LSTM for
    UNK is to represent every unseen words.

  • 语言的基础特征:前后缀、

    target hw1: 使用训练数据构建统计语言模型

相关推荐
忘路之远近i9 分钟前
受够阿里云自带终端后,我用 Cursor + grill-me 做了个运维面板
服务器·开发语言·人工智能·python·阿里云·云计算
朱涛的自习室12 分钟前
Munk AI 桌面端「预告」
android·前端·人工智能
www_comsci13 分钟前
【语言、教育类主题EI会议|Call For Paper】第二届人工智能与计算社会科学国际研讨会
人工智能·语言模型
祝威廉14 分钟前
四条语句跑完机器学习:让模型成为一个 SQL 函数
人工智能·sql·机器学习
superz丶19 分钟前
Claude Code / Codex 已经有 Harness,项目里还需要自己搭吗?
人工智能
TMT星球21 分钟前
荣耀将阿莱电影工作流融入机器人手机
人工智能·智能手机·机器人
沫儿笙22 分钟前
焊接机器人气保焊省气设备
人工智能·机器人
cxr82823 分钟前
物理信息约束生成式AI高分子逆向设计方法
人工智能·智能体·逆向设计合成·材料合成
郝学胜_神的一滴23 分钟前
Python 高级编程 026:序列内核深剖
python·pycharm
Margrop24 分钟前
用了 40 年的 TCP,为什么被 HTTP/3“抛弃”了?
人工智能