Python爬取js动态添加的内容

时间：2019-02-13 09:29:36 阅读：305 评论：0 收藏：0 [点我收藏+]

标签：print inux tco script asc webp .net article 爬取

技术图片


爬虫从 HTML 数据中提取出有效的信息。但是如果网页中含有 JavaScript 代码，网页会经过渲染处理。此时，如果我们仍采用常规方法从中抓取数据，那么我们将一无所获。那么，通过Web kit可以简单解决这个问题。Web kit 可以实现浏览器所能处理的任何事情。对于某些浏览器来说，Web kit就是其底层的网页渲染工具。Web kit是QT库的一部分，在安装QT和PyQT4库后，你可以直接运行下列代码。
windows下可以下载对应的包，cmd进入对应目录进行pip install;
linux下运行：sudo apt-get install python-qt4
https://www.lfd.uci.edu/~gohlke/pythonlibs/#pyqt4

import sys
from PyQt4.QtWebKit import *
from PyQt4.QtGui import *
from PyQt4.QtCore import *


class Render(QWebPage):  # 用来渲染网页,将url中的所有信息加载下来并存到一个新的框架中
    def __init__(self, url):
        self.app = QApplication(sys.argv)
        QWebPage.__init__(self)
        self.loadFinished.connect(self._loadFinished)
        self.mainFrame().load(QUrl(url))
        self.app.exec_()

    def _loadFinished(self, result):
        self.frame = self.mainFrame()
        self.app.quit()


url = ‘http://ddbank.net/edu/mod/resource/view.php?id=707‘
r = Render(url)
html = r.frame.toHtml()
print(html)

Python爬取js动态添加的内容

标签：print inux tco script asc webp .net article 爬取

原文地址：https://www.cnblogs.com/dreamyheart/p/10368031.html

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)

周排行