一、数据质量的保证

在构建医学知识图谱时,关于数据质量的要求要求特别高,一旦数据有错误,会造成医学知识图谱系统功能断裂,以及上层应用分析能力,从而影响系统的正常使用。数据质量的保证必须从基础的采集信息、加工过程中、存储方面等多个维度来考虑,以确保构建的医学知识图谱对系统的使用没有影响。
1. 数据信息采集
首先,采集数据时,要定义准确的数据来源,以便外界可以清晰地知道系统数据的真实性。另外,采集的信息必须保证不仅有高质量,还应考虑到充足的信息维度,如实体、属性、值、关系等,以便手动和自动二次处理。
2. 数据处理
为了保证数据的准确性和可用性,在构建医学知识图谱的过程中,需要经过多次的数据清洗、标准化、校验等步骤,以去除图中低质量、无效的信息,并将大量数据整理成有联系的标准格式的。
3. 数据存储
在存储图数据时,还需要考虑对数据的安全性和可靠性,确保加密传输、数据永不丢失,以及实施增量备份保护策略,避免数据发生意外遗失。
二、知识表达能力
在建立医学知识图谱时,要能正确、精确地表达医学知识,并在建立完整的知识体系中衔接。要正确表达,就要确定其语义,对某个医学术语或概念,需要准确地定义它的涵义,以及它的实体,类型和关系,并能有效存储在知识图谱数据库中。
1. 集成多源数据能力
因为医学知识数据來源广泛,通常由文献、历史病例和业绩等多种文献数据,因此构建知识图谱时,就需要对多源数据进行集成,处理以建立完整的知识框架。
2. 文字处理能力
医学领域的知识数据大部分来源于文档,因此要构建一个完整的知识图谱,需要文字处理技术进行词法、句法分析,并标定实体和关系的能力。
3. 知识推理能力
缺乏事实的时候,知识图谱中的实体和关系能通过推理有效地匹配,完成知识连接。此外,知识推理技术还可以用于拓展知识图谱本身,挖掘更多的不同层次的知识。
三、自然语言处理
自然语言处理是一项跨越计算机科学、语言学、信息工程和决策支持系统等学科的技术,是构建医学知识图谱的一个重要组成部分。通过自然语言处理,可以启动和支持知识推理,将文本信息抽取 transform 为有用的格式,以便构建知识图谱,提高搜索、查询的精度,支持专家系统的建设等。
1. 情感分析
在医学知识图谱可视