首页 > 资讯 > 数据库 >Scrapy中怎么利用Xpath选择器从网页中采集目标数据

833

分享到

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

2024-04-02 19:04:59 833人浏览薄情痞子

摘要

scrapy中怎么利用Xpath选择器从网页中采集目标数据，相信很多没有经验的人对此束手无策，为此本文总结了问题出现的原因和解决方法，通过这篇文章希望你能解决这个问题。/具体实现/1、针对标题，在上篇文章中

scrapy中怎么利用Xpath选择器从网页中采集目标数据，相信很多没有经验的人对此束手无策，为此本文总结了问题出现的原因和解决方法，通过这篇文章希望你能解决这个问题。

/具体实现/

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

1、针对标题，在上篇文章中就有提及，其Xpath表达式有多种，任选其一即可，在scrapy shell脚本下进行调试，得到标题的提取方式，并写入到爬虫主体文件中。

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

2、接下来是发布日期的提取，仍然是以交互式的方式实现网页与源码之间的交互，如下图所示。

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

3、而且标签“entry-meta-hide-on-mobile”具有全局唯一性，可以很方便的定位到元素。

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

4、根据网页结构，我们可轻易的写出发布日期的Xpath表达式，可以在scrapy shell中先进行测试，再将选择器表达式写入爬虫文件中，详情如下图所示。

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

这里有部分杂质信息，需要利用strip()和replace()函数剔除多余的杂质，还日期一个“清白”。

5、关于文章主题标签的Xpath表达式，可以看到其在网页结构上处于日期的下方，如下图所示。

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

因此可以通过更改一下发布日期的Xpath表达式，即可获取到文章主题标签。

6、文章主题标签处于a标签下，如下图所示。

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

获取到整个列表之后，利用join函数将数组中的元素以逗号连接生成一个新的字符串叫tags，然后写入Scrapy爬虫文件中去。

7、对于点赞数，其分析方法同之前一致，找到唯一的一个标签“vote-post-up”即可定位到数据。

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

8、细心的小伙伴可能会看到“vote-post-up”属性并不是class标签中唯一一个属性，所以一开始的Xpath表达式匹配的内容为空。

这里给大家安利一个小技巧，如果标签中存在多个属性，且属性是唯一的时候，可以利用contains函数进行助攻，其用法是'//span[contains(@class,"vote-post-up")，务必要多加练习，否则容易忘记。根据网页结构写出Xpath表达式，调试的过程如下图所示。

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

取出的点赞数是个字符串，需要利用int()将其强制转换为数字。

看完上述内容，你们掌握Scrapy中怎么利用Xpath选择器从网页中采集目标数据的方法了吗？如果还想学到更多技能或想了解更多相关内容，欢迎关注编程网数据库频道，感谢各位的阅读！

您可能感兴趣的文档:

--结束END--

本文标题: Scrapy中怎么利用Xpath选择器从网页中采集目标数据

本文链接: https://lsjlt.com/news/56680.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

回答

如何调试操作系统的错误？
操作系统

2023-11-15发布

回答

操作系统中的I/O系统是如何实现的？
操作系统

2023-11-15发布

回答

如何实现操作系统的内存管理？
操作系统

2023-11-15发布

回答

什么是虚拟内存，它对操作系统有什么影响？
操作系统

2023-11-15发布

回答

ASP中的MVC架构和WebForms架构有什么区别和使用场景？
ASP.NET

2023-11-15发布

回答

ASP中的数据验证和数据校验有什么不同？
ASP.NET

2023-11-15发布

回答

ASP中的ADO对象和DAO对象有什么区别和使用方法？
ASP.NET

2023-11-15发布

回答

Node.js中的包管理器NPM是什么？如何使用它进行依赖管理？
node.js

2023-11-15发布

回答

Vue.js中的动态组件是什么？如何使用它来动态渲染组件？
VUE

2023-11-15发布

回答

如何使用Vue.js实现懒加载和预加载？
VUE

2023-11-15发布

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

Scrapy中怎么利用Xpath选择器从网页中采集目标数据

在Scrapy中怎么利用CSS选择器从网页中采集目标数据

Xpath元素选择器怎么在Scrapy中使用

服务器租用怎么选择数据中心

关于SQL建表语句使用详解

HBase在大数据审计与合规性追踪中的应用

MySQL与HBase在大数据金融分析中的性能与可扩展性对比

HBase的Region Server之间的网络通信优化

HBase在大数据监控与告警系统中的实时数据处理能力

MySQL与HBase在大数据安全策略中的实现与对比

HBase的分布式事务处理在复杂业务场景中的应用

MySQL与HBase在混合存储架构中的整合策略

HBase如何支持高效的二级索引查询

MySQL与HBase在物联网数据收集与处理中的协作模式