作者投稿和查稿 主编审稿 专家审稿 编委审稿 远程编辑

计算机工程 ›› 2012, Vol. 38 ›› Issue (2): 48-50. doi: 10.3969/j.issn.1000-3428.2012.02.015

• 软件技术与数据库 • 上一篇    下一篇

基于相似URL的深层网数据区域识别

孔燕燕,施化吉   

  1. (江苏大学计算机科学与通信工程学院,江苏 镇江 212013)
  • 收稿日期:2011-06-08 出版日期:2012-01-20 发布日期:2012-01-20
  • 作者简介:孔燕燕(1985-),女,硕士研究生,主研方向:Web数据挖掘;施化吉,教授
  • 基金资助:

    国家自然科学基金资助项目(61003288)

Deep Web Data Region Identification Based on Similar URL

KONG Yan-yan, SHI Hua-ji   

  1. (School of Computer Science and Telecommunication Engineering, Jiangsu University, Zhenjiang 212013, China)
  • Received:2011-06-08 Online:2012-01-20 Published:2012-01-20

摘要: 针对深层网查询结果页面中噪音信息对数据区域识别的干扰问题,提出一种自动识别深层网查询结果数据区域的方法。该方法利用网页的重复结构和相似URL,将页面划分成不同的语义块,依据不同页面块之间URL的相似性识别出数据区域。实验结果表明,该方法能够提高数据区域识别的召回率和准确率。

关键词: 深层网, 重复结构, 相似URL, 语义块, 数据区域

Abstract: Aiming at the problem that the noise information may interfere with the identification of the data region in Deep Web search result pages. This paper proposes an automatic approach to identify data region in Deep Web search result list pages. It employs continuous repetitive structure and similar URL to divide the sample pages into different semantic blocks, and identifies the block where the data region locates. Experimental results show the approzch can imprave the recall rate and accuracy of the date region identification.

Key words: Deep Web, repetitive structure, similar URL, semantic block, data region

中图分类号: