您好,欢迎光临本网站![请登录][注册会员]  

搜索资源列表

  1. 贪心学院transformer模型讲解记录

  2. 1.FFN层和z1和z2层是不同的,FFN层是隔开的,权重不共享的,而Z1和Z2不是隔开的 2.Q,K,V是借鉴了搜索的思维在里面,Q是query的意思,是的意思,Q值就是word应该映射一会进行搜索的值,K是搜索的目标,V是目标值,类似K是文档的主题,V是文档的向量,Q是搜索文档的文本。这样就能训练得到word与word之间的关系,不同的W就表示搜索的维度不一样 3.借鉴ResNet思想,embedding层可以越过normalize处理结果,防止梯度消失,因为添加上面可以直接反馈到最下面
  3. 所属分类:其它

    • 发布日期:2021-01-20
    • 文件大小:367616
    • 提供者:weixin_38711369