分类导航

PHP教程|ASP.NET教程|Java教程|ASP教程|编程技术|正则表达式|C/C++|IOS|C#|Swift|Android|VB|R语言|JavaScript|易语言|vb.net|

服务器之家 - 编程语言 - 编程技术 - 火车头采集器采集多页内容的抓取教程

火车头采集器采集多页内容的抓取教程

2020-07-19 00:44编程技术网编程技术

本文主要讲解使用火车头采集器采集多页内容的抓取教程，有需要的朋友可以参考下

我们以内容页网址http://kimi201406.1688.com/page/creditdetail.htm为例，来获取它的公司介绍和联系方式页面的联系方式信息。

公司介绍在网址http://kimi201406.1688.com/page/creditdetail.htm里获取，而联系方式信息在网址http://kimi201406.1688.com/page/contactinfo.htm里获取。所以我们需要借助多页功能来实现。前者叫默认页地址，后者叫做多页地址。

流程：点击①创建多页，进行②多页设置，然后在数据来源③选择多页调用，最后根据多页源代码设置提取方式。

火车头采集器采集多页内容的抓取教程

下面重点讲解②，多页地址的两种获取方式：页面地址替换和源码中截取。

1.页面地址替换：也就是默认页和多页地址有相同的地方，通过简单的替换就可以变成多页地址。

比较默认页“http://kimi201406.1688.com/page/creditdetail.htm”和多页地址：“http: //kimi201406.1688.com/page/contactinfo.htm”之间的共同点，可以发现默认页“creditdetail.htm”替换为“contactinfo.htm”就是我们的多页地址了。

设置如下图：

火车头采集器采集多页内容的抓取教程

注：正则表达式中 (.*) 为任意通配符。$1,$2…$数字来按照顺序对应上面(.*)表示的部分。若要对多页源码部分区域做限定，可在指定多页源码区域设置。

若留空则默认返回多页整个源代码。设置好以后，点击测试查看结果即可。

2.源码中截取：也就是多页的地址在默认页的页面源代码里面。

如图，可以看到默认页源码中存在多页地址。

火车头采集器采集多页内容的抓取教程

所以设置如下：

火车头采集器采集多页内容的抓取教程

测试后如正确则保存即可。最后设置数据来源和提取方式，如图：

火车头采集器采集多页内容的抓取教程

注：如需要多级多页，则在多页地址获取方式选择需要的多页即可

火车头采集器采集多页内容的抓取教程

这两种获取方式大家掌握了吗，今后在抓取网站时使用火车采集器V9的上述操作就可以很容易地获取到关联的多页地址了，作为一款功能全面的网站抓取精灵，火车采集器一定会充分考虑到用户的使用需求，以及如何最大化实现便利

火车头采集器

延伸 · 阅读

精彩推荐

编程技术

聊聊接口性能优化的11个小技巧

接口性能优化对于从事后端开发的同学来说，肯定再熟悉不过了，因为它是一个跟开发语言无关的公共问题。...

苏三说技术8302021-11-18
编程技术

Rust 能够取代 C 语言吗

Rust 是 Mozilla 基金会的一个雄心勃勃的项目，号称是 C 语言和 C++ 的继任者，这篇文章主要介绍了Rust 能够取代 C 语言吗的相关知识,需要的朋友可以参考下...

TGeek5512020-06-30
编程技术

火车头采集器采集多页内容的抓取教程

本文主要讲解使用火车头采集器采集多页内容的抓取教程，有需要的朋友可以参考下...

编程技术网9852020-07-19
编程技术

前端:使用CSS3实现酷炫的3D旋转透视

3D动画效果现在越来越普及，已经被广泛的应用到了各个平台，比如阿里云，华为云，webpack官网等。它可以更接近于真实的展示我们的产品和介绍，带来极...

趣谈前端9762021-01-05
编程技术

网络编程之get与post的区别与联系

这里来说说get与post的区别与联系，对这方面不懂的同学可以参考下。...

编程技术网5262020-07-19
编程技术

分布式计算之数据质量漫谈

数据探查不止用在数据质量领域，数仓开发、数据迁移等都需要对源数据进行数据探查。数据仓库的所有数据基础都是源数据（ODS），在开发数仓之前，需...

阿里技术5212021-12-28
编程技术

git和SVN的区别小结

这篇主要是谈谈两者的区别，svn是集中式版本控制系统，git是分布式版本控制系统，至于谁优谁劣看官自己思考吧， ...

撒野女孩4262020-07-13
编程技术

一道算法小题的分析过程

最近在看算法的问题比较多，希望能以一道小题，来记录算法分析的过程。题目是: Pig Latin...

前端思维框架12382021-03-02