1、倪琳2024.05.25AI增强软件工程从概念到实践的全生命周期应用目录CONTENTS1.LLM简单介绍2.AIASE现状3.AIASE实践4.思考5.提问LLM简单介绍大语言模型(LLM)大语言模型(LLM)是基于海量文本数据训练的深度学习模型(百度百科)2023大模型关键进展“各门各户”经准备成长后快速爆发,各行各业开源闭源大模型层出不穷2023年值得关注的中文大模型全景图百模大战,很难说谁优谁劣LLM能力简单示例语言理解与生成专业技能与计算工具使用LLM生态LLM应用呈井喷式进入更多行业领域,并逐渐开始产品探索AIASE现状AIASE应用领域现在的生产落地领域、仍然集中在编码阶段前后的
2、代码相关的工作辅助上AIASE应用领域智能编码助,是模型产品中前探索较深,产品形态较完善的AIASE工具使用状况报告来源于Stack overflow的2023 Developer Survey,调研了全球超过9万名开发者开发者们尝试使用AI工具去搜索以及辅助开发,从AI中受益;逐渐信任AI的准确率AI Search ToolsAI Developer Tools从AI中受益对于AI准确率的信任AIASE应用分析应用最多=?高价值AIASE热门项目情况MetaGPTDevOpsGPTOpenDevinAIASE的发展与局限AIASE开源项目百花齐放,demo效果十分惊人,但鲜有生产落地AIAS
3、E发展策略不同LLM协作方式的成本微调LLM微调方式对LLM模型的主流微调方式有4种:Freeze,即参数冻结,对原始模型部分参数进行冻结操作,可训练参数由自行修改对哪些层进行微调决定;P-Tuning,仅对大模型的Embedding加入新的参数,可训练参数占比0.0586%;P-Tuning-V2,将大模型的Embedding和每一层前都加上新的参数,可训练参数占比13.26%;Lora,即在大型语言模型上对指定参数(权重矩阵)并行增加额外的低秩矩阵,仅训练低秩矩阵,可训练参数占比0.0586%FreezeP-TuningP-Tuning-V2Lora向量知识库将私有化知识或复杂上下文作为知
4、识库,通过LLM+RAG来搭建垂直领域的深度服务AIASE实践我们在AIASE下的实践Lorem ipsum dolor sit amet consectetur adipisicing elit sed do eiusmod temporLorem ipsum dolor sit amet consectetur adipisicing elit sed do eiusmod temporLorem ipsum dolor sit amet consectetur adipisicing elit sed do eiusmod tempor需求分析用户故事地图用户故事设计API设计DSL设计
5、东软内部前端组件库东软内部UXD设计思想生成可运行前端代码.Langchain框架向量知识库提示词工程Chains思考Few-shotLLM生成SE全流程成果物API设计实体属性列表数据库DDL以业务描述/用例规约为输入,生成用户故事地图用户故事测试用例时序图实体及属性数据库DDL前端代码Api说明运行页面前端DSL及代码用户故事原始输入经验总结使用Prompt工程的小技巧:few-shot、chains of thought、复杂问题分解等效果不错是由于实验场景是基于通识的业务场景,其问题域包含在LLM的训练语料中缺少专业领域泛化性专业领域泛化性的问题,可通过RAG(知识库)或微调来解决微调
6、需要大量数据(以百万为单位)和算力(GPU)支持向量知识库需要考虑清楚建库的目的和所需知识“实验”和“生产”的区别,LLM的幻觉是项目真实落地的最大阻碍23年 前端典型功能代码生成技术路线整体流程OLF:Object List Floorplan 对象列表布局SOF:Simple Object Floorplan 简单对象布局代码模板符合东软内部的前端开发框架24年 前端典型功能代码生成技术路线整体流程Gua组件库:东软内部前端代码组件库前端典型功能代码-开发者通过Chat模