源码剖析 – 公众号采集阅读器 Liuli

简介
无意中发现 Liuli 这个项目,项目 Github:https://github.com/liuli-io/liuli
看了其文章,发现 Liuli 是 Python 实现的,便打算简单看看其实现细节,老规矩,看项目,先将好奇点写下来:
1.Python 怎么实现宣传文章中那么漂亮的 PC 软件界面的?2. 如何采集公众号文章?
对,我就对这两点感兴趣,经过一番阅读后,关于好奇 1,其实人家没有实现漂亮的 PC 软件界面,Liuli 只是采集,然后将内容推送过去,所以本文的重点,就是看一下它是怎么采集公众号文章的,此外在阅读过程中,发现 LiuLi 还使用了简单的方法来识别文章是否为广告文章,这点也挺有意思的,也记录一下。
公众号文章采集
Liuli 基于搜狗微信(https://weixin.sogou.com/)对公众号文章进行采集,而且实现了 2 种方式:
使用 playwright 自动化浏览器的方式实现公众号文章采集使用 ruia 爬虫框架实现公众号文章的采集
我们可以通过相应的配置文件控制 Liul

源码剖析 – 公众号采集阅读器 Liuli最先出现在Python成神之路

版权声明:
作者:admin
链接:https://www.techfm.club/p/18428.html
来源:TechFM
文章版权归作者所有,未经允许请勿转载。

THE END
分享
二维码
< <上一篇
下一篇>>