当前位置:首页 > 报告详情

复旦大学:2023大规模语言模型中语言与知识(47页).pdf

上传人: AG 编号:608441 2024-01-01 47页 3.93MB

1、ML-Summit 2023大规模语言模型中语言与知识张奇复旦大学ML-Summit 2023 全球机器学习技术大会ML-Summit 2023目录Multilingual BERT 中存在多语言对齐现象1大语言模型中多语言对齐2大语言模型中的语言和知识分离3ML-Summit 202301Multilingual BERT 中存在多语言对齐现象ML-Summit 2023MULTILINGUAL BERT 中存在多语言对齐现象Xu et al.Cross-Linguistic Syntactic Difference in Multilingual BERT:How Good is It a

2、nd How Does It Affect Transfer?EMNLP2022mBERT 不同层恢复各类语言语法关系的准确性。ML-Summit 2023MULTILINGUAL BERT 中存在多语言对齐现象Xu et al.Cross-Linguistic Syntactic Difference in Multilingual BERT:How Good is It and How Does It Affect Transfer?EMNLP2022mBERT 第 7 层的不同语法关系表示的可视化。ML-Summit 2023MULTILINGUAL BERT 中存在多语言对齐现象Xu

3、et al.Cross-Linguistic Syntactic Difference in Multilingual BERT:How Good is It and How Does It Affect Transfer?EMNLP2022mBERT 第 7 层的不同语法关系表示的可视化在进行任务Fine-Tune之后,聚合对齐更加明显ML-Summit 2023在大语言模型中有类似现象吗?ML-Summit 202302大语言模型中多语言对齐ML-Summit 2023大语言模型中也存在类似现象Xu et al.Are Structural Concepts Universal in Tr

4、ansformer Language Models?Towards Interpretable Cross-Lingual Generalization,EMNLP 2023语言直接在句法关系上具有很强的对齐性ML-Summit 2023大语言模型中也存在类似现象Xu et al.Are Structural Concepts Universal in Transformer Language Models?Towards Interpretable Cross-Lingual Generalization,EMNLP 2023词性标注任务,可以通过跨语言训练得到非常高的结果ML-Summit

5、 2023通过多语言模型预训练,多语言语义在模型中已经完成对齐ML-Summit 2023大规模语言模型中多语言对齐Zhao et al.LLaMA Beyond English:An Empirical Study on Language Capability Transfer.AAAI 2024 submittedML-Summit 2023大规模语言模型中多语言对齐Zhao et al.LLaMA Beyond English:An Empirical Study on Language Capability Transfer.AAAI 2024 submitted比较如下模型:LLaM

6、A(Touvron et al.2023a)LLaMA2(Touvron et al.2023b)Chinese LLaMA(Cui,Yang,and Yao 2023b)基于LLaMA,扩展中文词元,30B中文Token语料二次训练(120GB)Chinese LLaMA2(Cui,Yang,and Yao 2023a)基于LLaMA2,扩展中文词元,30B中文Token语料二次训练Open Chinese LLaMA(OpenLMLab 2023)基于LLaMA,扩展中文词元,100B中英混合Token语料二次训练LLaMA+10K、LLaMA+100K、LLaMA+1M基于LLamA不扩

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
本文主要探讨了大规模语言模型中的语言与知识问题。首先,作者介绍了多语言模型中存在多语言对齐现象,例如mBERT在不同层恢复各类语言语法关系的准确性。其次,作者提出了大语言模型中的语言和知识分离问题,并比较了不同模型在多语言对齐方面的表现。然后,作者探讨了大模型中的语言核心区和非核心区的确定方法,以及这些区域参数的敏感性。作者发现,模型对语言核心区的参数非常敏感,而随机扰动非核心区参数会导致模型性能下降。最后,作者提出了二次预训练方法和训练数据构造的重要性,以保证模型在特定任务上的表现。总之,本文揭示了大规模语言模型在语言与知识处理方面的挑战和机遇。
"大模型中的语言核心区是什么?" "如何确定大模型中的语言核心区和非核心区?" "大模型语言核心区与维度依赖理论能带来什么?"
客服
商务合作
小程序
服务号
折叠