主页期刊介绍编委会编辑部服务介绍道德声明在线审稿编委办公编辑办公English
     
在线出版
各期目录
纸质出版
分辑系列
论文检索
论文排行
综述文章
专刊文章
美文分享
各期封面
E-mail Alerts
RSS
旧版入口
中国科学院软件研究所
  
投稿指南 问题解答 下载区 收费标准 在线投稿
周水庚,胡运发,关佶红.基于邻接矩阵的全文索引模型.软件学报,2002,13(10):1933-1942
基于邻接矩阵的全文索引模型
Adjacency Matrix Based Full-Text Indexing Models
投稿时间:2002-01-18  修订日期:2002-07-01
DOI:
中文关键词:  信息检索  全文索引  倒排文件  PAT数组  邻接矩阵  模型
英文关键词:information retrieval  full-text indexing  inverted file  PAT array  adjacency matrix  model
基金项目:Supported by the National Natural Science Foundation of China under Grant No.60173027 (国家自然科学基金); the Natural Science Foundation of Hubei Province of China under Grant No.2001ABB050 (湖北省自然科学基金)
作者单位
周水庚 复旦大学,计算机科学与工程系,上海,200433 
胡运发 复旦大学,计算机科学与工程系,上海,200433 
关佶红 武汉大学,计算机学院,湖北,武汉,430079 
摘要点击次数: 3367
全文下载次数: 3420
中文摘要:
      文本信息的急剧增加和越来越多的用户通过在线方式获取文本信息,使得查询效率成为信息检索系统一个突出瓶颈.提出两种新型全文索引模型,用于改善信息检索系统的查询效率.通过使用有向图表示文本串,引出关于文本串的邻接矩阵;采用两种不同的方式实现文本串邻接矩阵,导出了两种基于邻接矩阵的新型全文索引模型,即基于邻接矩阵的倒排文件和基于邻接矩阵的PAT数组.给出了基于新模型的文本查询算法;分析了新模型的存储空间和查询时间的开销,并分别与两种传统索引模型进行了比较.对实际文本库进行了测试以证实新模型的效能.新模型能够以相对于原文较小的空间代价获得较大幅度的查询效率的提高,因此适合于在大规模文本检索系统中应用.
英文摘要:
      With the rapid growth of online text information and user accesses, query-processing efficiency has become the major bottleneck of information retri eval (IR) systems. This paper proposes two new full-text indexing models to impr ove query-processing efficiency of IR systems. By using directed graph to repres ent text string, the adjacency matrix of text string is introduced. Two approach es are proposed to implement the adjacency matrix of text string, which leads to two new full-text indexing models, I.e., adjacency matrix based inverted file and adjacency matrix based PAT array. Query algorithms for the new models are dev eloped and performance comparisons between the new models and the traditional models are carried out. Experiments over real-world text collections are conducted to validate the effectiveness and efficiency of the new models. The new models can improve query-processing efficiency considerably at the cost of much less amount of extra storage overhead compared to the size of original text database, so are suitable for applications of large-scale text databases.
HTML  下载PDF全文  查看/发表评论  下载PDF阅读器
 

京公网安备 11040202500064号

主办单位:中国科学院软件研究所 中国计算机学会 京ICP备05046678号-4
编辑部电话:+86-10-62562563 E-mail: jos@iscas.ac.cn
Copyright 中国科学院软件研究所《软件学报》版权所有 All Rights Reserved
本刊全文数据库版权所有,未经许可,不得转载,本刊保留追究法律责任的权利