中国科学院知识创新工程重要方向项目(KGCX2-SW-511)
自Jesse James Garrett 提出了AJAX 概念以来,由于AJAX 在提升用户交互体验的同时,又不需要在客户端安装插件。因此,一经提出就引起了互联网领域的广泛关注。但目前的网络爬虫技术在AJAX框架的URL 解析过程中存在着不能够识别事件触发顺序等问题,导致大量数据不能被搜索引擎有效检索。本文针对此问题,通过研究基于对象的程序切片算法,以及脚本执行引擎与切片模块的互操作,最终解决AJAX 框架中URL 提取以及异步JavaScript 网络爬虫系统的关键技术问题。
曾伟辉,李 淼.基于JavaScript 切片的AJAX 框架网络爬虫技术研究.计算机系统应用,2009,18(7):169-171
京公网安备 11040202500063号