【摘要】本发明提供一种基于中文检索的双向分词方法和装置,能够比较准确地切分中文字串而不丢失其语义,尤其在句子长度较长时分词结果比较准确,有利于提高查询的准确度,可应用于信息检索领域的自动文摘和自动分类系统。 :【专利类型】发明申请【申请人】
【摘要】 一种状态监测数据的分布式存储与并行挖掘方法,它通过Web服务描述语言定义变电站状态监测远程单元与状态监测通信前置机的功能服务模型,通过简单对象访问协议进行电力广域网环境下电力设备状态监测数据交换;它将大规模状态监测数据冗余存储在分布式文件系统中,对状态监测数据文件创建索引表,并插入到大规模结构化数据表中,根据查询请求完成状态监测数据查询;通过提取、转换与加载生成基础数据与多维度的分析性数据建立数据仓库,并通过MapReduce任务分解与结果汇总,实现关联规则、分类和聚类数据挖掘算法的并行执行。本发明能有效地对智能电网环境下海量电力设备状态监测信息进行分布式数据交换、冗余存储与快速并行处理。 【专利类型】发明授权 【申请人】华北电力大学(保定) 【申请人类型】学校 【申请人地址】071003 河北省保定市永华北大街619号 【申请人地区】中国 【申请人城市】保定市 【申请人区县】莲池区 【申请号】CN201210130726.8 【申请日】2012-04-29 【申请年份】2012 【公开公告号】CN102685221B 【公开公告日】2014-12-03 【公开公告年份】2014 【授权公告号】CN102685221B 【授权公告日】2014-12-03 【授权公告年份】2014.0 【IPC分类号】H04L29/08; H04L12/26 【发明人】王德文; 宋亚奇; 肖磊; 肖凯 【主权项内容】一种状态监测数据的分布式存储与并行挖掘方法,其特征是,通过Web服务描述语言定义变电站状态监测远程单元与状态监测通信前置机的功能服务模型,通过简单对象访问协议进行电力广域网环境下电力设备状态监测数据交换;将大规模状态监测数据冗余存储在分布式文件系统中,对状态监测数据文件创建索引表,并插入到大规模结构化数据表中,根据查询请求完成状态监测数据查询;通过提取、转换与加载生成基础数据与多维度的分析性数据建立数据仓库,并通过映射与化简并行编程模型进行任务分解与结果汇总,实现关联规则、分类和聚类数据挖掘算法的并行执行;状态监测数据仓库建立与数据挖掘并行化处理步骤如下:a.状态监测数据的抽取:对于现有的长期存储在关系型数据库中的电力设备历史状态数据,经过数据净化、转换、标准化后,以文件的形式存储于HDFS的数据结点上;b.状态监测数据仓库的建立:首先采用Hive查询语言HiveQL创建表,表的定义、字段以及间隔符信息均存储于元数据库中,然后加载HDFS数据文件到表以构造数据文件目录;根据变电站、设备类型、监测类型与时间状态监测主题组织成分区,按照列属性将数据组织成数据桶;c.状态监测数据分析:客户端发起状态监测数据分析请求,根据请求命令的内容查询元数据库中对应的表模式,若满足则进入数据文件目录查询相应的表,通过HiveQL找到状态监测量字段,获取满足条件的状态量值,进行聚类、求和、汇总、报表生成操作,最后,将操作生成的查询分析计划存储在HDFS数据仓库中,并将状态数据分析结果返回给客户端;d.状态监测数据挖掘的并行化:将包括关联规则、分类和聚类的算法运行分发给作业进程管理下的各个任务进程共同完成;设置并行化引擎实例,通过映射与化简并行编程模型MapReduce将学习过程中的大规模数据集运算分割为若干训练子集分配给多个映射节点Mapper,在映射节点上分别执行各种操作得到中间结果,最后通过化简节点Reducer将结果合并,实现算法的并行执行。 【当前权利人】华北电力大学(保定) 【当前专利权人地址】河北省保定市永华北大街619号 【专利权人类型】公立 【统一社会信用代码】12100000401889410E 【引证次数】3.0 【被引证次数】1 【自引次数】1.0 【他引次数】2.0 【被他引次数】1.0 【家族引证次数】3.0 【家族被引证次数】124
未经允许不得转载:http://www.zhongzhencnc.com/1790993710.html






