1、DataFunSummitDataFunSummit#20242024基于LLM的智能数据分析平台落地实践谭云志/腾讯 高级研究员从传统BI到智能BILLM时代智能BI的新可能腾讯OlaChat智能BI平台落地实践01从传统BI到智能BI从传统数据分析到智能数据分析199620112019第二代敏捷BI第三代智能BI使用人群:一线业务人员用户范围:多数人响应周期:天级别使用门槛:中使用人群:人人都是分析师用户范围:全部人响应周期:秒/分钟级别使用门槛:低第一代传统BI使用人群:老板、业务负责人用户范围:少数人响应周期:周级别使用门槛:高02LLM时代智能BI的新可能大语言模型(LLM)给智能分
2、析带来全新的可能语言能力:理解和处理人类语言的复杂结构和含义,理解和分析各种形式的数据,包括文本、表格等;自然语言的交互形式可以使得数据分析更加直观和易于理解工具使用:能够实现对工具的调用和代码的生成,如:text2api、text2sql、text2code、text2x逻辑推理:从数据中发现模式、趋势和关联性,帮助用户进行更深入的数据分析和洞察学习能力:使用少量优质的数据集微调能快速的学会某一个领域的知识,模型迁移成本低Zhao,Wayne Xin,et al.A survey of large language models.arXiv preprint arXiv:2303.18223
3、(2023).大语言模型(LLM)给智能分析带来全新的可能欧拉&灯塔数据表、指标、画像、看板LLM语言能力、工具使用、逻辑推理、学习能力OlaChat基于LLM和腾讯大数据平台丰富的数据资产所打造的智能数据分析平台,基于自然语言的交互形式,有效降低用户查数、取数、用数的门槛03腾讯OlaChat智能BI平台落地实践 多任务对话系统 元数据检索增强 text2sql text2sql之外腾讯OlaChat智能BI平台的关键能力多任务对话系统任务编排引擎AI+BI工具箱Query改写意图识别指标分析人群洞察表查找text2sql图表绘制数据解读智能推荐SQL优化公共服务智能的多任务对话系统,低门槛
4、的人机交互入口 上下文理解(Context Understanding):基于用户的历史对话,准确理解用户的需求,补充缺失信息 意图识别(Intention Detection):将用户的需求映射到某一项特定的意图,便于后续流程更有针对性的进行处理 自然语言理解模块(NLU):将用户文本消息转化为可以被机器理解的语义标签,如意图、槽位和槽值 对话状态跟踪模块(DST):在对话中的每一轮基于对话历史维护最新的对话状态,通常表示为一组槽位-槽值对 对话策略模块(DPL):基于当前的对话状态,决定对话系统的下一步动作,比如确认用户的需要,查询数据库和提供满足条件的结果等 自然语言生成模块(NLG):
5、将对话策略模块决定的系统对话行为转换成人类的语言,回复给用户拒绝/澄清&引导/推荐元数据检索增强(MetaRAG)通用检索增强生成(RAG)设计方案通用RAG在解决元数据检索增强任务时存在一定的不适用性,主要因为:元数据是按特定的结构、层次组织的指标、字段、维度的组合方式不符合语言模型的基本假设特定修饰词很重要,如“有效”、“付费”字段名可以很短,如“播放vv”结构化元数据检索:基于用户的Query,确定用哪个“指标+维度”或者哪些“表+字段”可以获取到数据来满足用户的需求。要求尽可能精确,以便减少传递给LLM的噪声,避免获取到的数据不符合要求元数据检索增强(MetaRAG)Flattened
6、RAG(F-RAG)通过枚举元数据的不同组合,将元数据所对应的数据集转化为问答知识库,从而实现结构化元数据的非结构化表示 问答知识库作为自然语言和结构化元数据的中间层,MetaRAG问题转化为传统的RAG问题 准确度高,无法有效解决长尾问题StructuredRAG(S-RAG)充分利用好元数据的结构特性,先召回用户的核心数据需求(如:指标),再基于此进行过滤召回修饰条件(如:维度、维度值)基于召回的候选实体(如:指标、维度、维度值),训练数据选取大模型用于确定最符合用户需求的元数据组合 准确度稍低,可以有效解决长尾问题元数据检索增强:FlattenedRAG离线知识库生成1.人工标注所需支持