用Python的Django框架编写从Google Adsense中获得报表的应用


Posted in Python onApril 17, 2015

 我完成了更新我们在 Neutron的实时收入统计。在我花了一周的时间完成并且更新了我们的PHP脚本之后,我最终认决定开始使用Python进行抓取,这是值得我去花费我的时间和精力的事情。我建立了一个 Django程序,它可以从不同的来源存储收入统计,我可以用这些去简历视图和用于统计工具的API。

所以在过去的几天里,我写了一个脚本,它可以登入到其他的网页并抓取数据,或者,如果这些网页有 API,可以直接访问 API。我发现了一些事情。

1.requests >httplib2(requests多于httplib2);

2.SOAP很糟糕,但它至少是一个API,Suds使SOAP好一点。我了解到SOAP是我说知道的API中,唯一一个完全基于.net开发的。

3.Beautiful Soup是一个很好的求助对象;

4.我确实十分惊讶,这么多企业能在如此蹩脚的技术中生存下来。
 

我拯救了 Google Adsense,他们将会拥有最好的API,并且因此成为最简单的实现。他有着比我预想的要多的挑战。显然你无法仅仅插入用户名/密码或是APIkey去获取获得进入API的入口,你必须完成整个Oauth2的握手流程。

不幸的是,我发现文档不如我希望过得那样容易查询。我发现了很多死链接。我认为,在这方面Google的人应该做的更好。例如,在他们的up to date developer docs文档中,我发现他们指出了broken link to read more about authentication and authorization。(好的,多么奇怪,我尽快提交了这个问题,这个链接终于开始工作了,我猜你会感谢我。)

所以,这篇博客将尝试记录从Adsense获取报表到我的Django应用的过程。

为了使用Google的API来访问Adsense报表,你需要使用Adsense Management API. 这个API只提供OAuth,所以你需要在浏览器中至少完成一次认证过程,来获取你的证书,然后你可以保存这些证书来进行下一步操作。说实话,我已经听说过OAuth很多次了,但是直到现在,我在实践中仍没有需要来使用它。所以我是边做边学,并欢迎大家留言指出我说的不对的地方。

就我所知,Google对于它的各种产品都拥有一个庞大的API。在研究Adsense之前,你需要在Google API 控制台注册你的应用。我已经成功注册了我的应用。因为我还没有一个可用的URL地址,我现在暂时使用我的开发URL(localhost:8000)。它运作起来似乎正常。并使用提供的这个链接下载JSON文件。

还有,当你管理你的APIs的时候,你需要打开服务选项卡,打开AdSense Management API选项。否则,当你尝试发送请求的时候,你会得到一个错误消息“Access Not Configured”。

Google已经创建了一个Python 客户端库,你可以轻易的通过pip来安装这个库。它还包含一个Django样例项目,这个项目使用这个库实现OAuth2的握手过程。我想,它是使用Django 1.1编写的(因为在写这个项目的时候,Django 1.5才刚刚发布),所以它可能有点过时,但是它可是一个好的开始点。

我的应用很简单。我只需要读取指定日期的收益金额,并保存到我的本地数据库。

我在djaongo项目中创建了一个新的应用,叫做“adsense”。并创建了一个models.py文件来存储认证证书。
 

from django.contrib.auth.models import User
from django.db import models
from oauth2client.django_orm import CredentialsField
 
class Credential(models.Model):
  id = models.ForeignKey(User, primary_key=True)
  credential = CredentialsField()
 
class Revenue(models.Model):
  date = models.DateField(unique=True)
  revenue = models.DecimalField(max_digits=7, decimal_places=2)
 
  def __unicode__(self):
    return '{0} ${1}'.format(self.date, self.revenue)

我把从API控制台下载的JSON文件放到我的应用的文件夹下面,并创建了一个views.py文件

 

import os
 
from django.conf import settings
from django.contrib.auth.decorators import login_required
from django.contrib.sites.models import Site
from django.http import HttpResponseBadRequest, HttpResponse
from django.http import HttpResponseRedirect
from oauth2client import xsrfutil
from oauth2client.client import flow_from_clientsecrets
from oauth2client.django_orm import Storage
 
from .models import Credential
 
CLIENT_SECRETS = os.path.join(os.path.dirname(__file__), 'client_secrets.json')
 
FLOW = flow_from_clientsecrets(
  CLIENT_SECRETS,
  scope='https://www.googleapis.com/auth/adsense.readonly',
  redirect_uri='http://{0}/adsense/oauth2callback/'.format(
    Site.objects.get_current().domain))
 
@login_required
def index(request):
  storage = Storage(Credential, 'id', request.user, 'credential')
  credential = storage.get()
  if credential is None or credential.invalid is True:
    FLOW.params['state'] = xsrfutil.generate_token(settings.SECRET_KEY,
                            request.user)
    authorize_url = FLOW.step1_get_authorize_url()
    return HttpResponseRedirect(authorize_url)
  else:
    return HttpResponse('Already validated.')
 
@login_required
def auth_return(request):
  if not xsrfutil.validate_token(settings.SECRET_KEY,
                  request.REQUEST['state'], request.user):
    return HttpResponseBadRequest()
  credential = FLOW.step2_exchange(request.REQUEST)
  storage = Storage(Credential, 'id', request.user, 'credential')
  storage.put(credential)
  return HttpResponseRedirect("/")

在 urls.py 文件中我包含了一个链接指向我的应用的url文件

main urls.py:
 
from django.conf.urls import patterns, include, url
from django.contrib import admin
 
admin.autodiscover()
 
urlpatterns = patterns(
  '',
  url(r'^adsense/', include('adsense.urls', namespace='adsense')),
 
  url(r'^admin/doc/', include('django.contrib.admindocs.urls')),
  url(r'^admin/', include(admin.site.urls)),
)

adsense/urls.py:
 
from django.conf.urls import patterns, url
 
urlpatterns = patterns(
  'adsense.views',
  url(r'^$', 'index', name='index'),
  url(r'^oauth2callback/$', 'auth_return', name='auth_return'),
)

最后,创建了一个通过给定日期调用API并获取收益的类。它放在adsense/tasks.py,因为我准备把它当作任务,钩在 Celery/ RabbitMQ之上。
 

import datetime
import httplib2
 
from apiclient.discovery import build
from django.contrib.auth.models import User
from oauth2client.django_orm import Storage
 
from .models import Credential, Revenue
 
TODAY = datetime.date.today()
YESTERDAY = TODAY - datetime.timedelta(days=1)
 
class Scraper(object):
  def get_report(self, start_date=YESTERDAY, end_date=TODAY):
    user = User.objects.get(pk=1)
    storage = Storage(Credential, 'id', user, 'credential')
    credential = storage.get()
    if not credential is None or credential.invalid is False:
      http = httplib2.Http()
      http = credential.authorize(http)
      service = build('adsense', 'v1.2', http=http)
      reports = service.reports()
      report = reports.generate(
        startDate=start_date.strftime('%Y-%m-%d'),
        endDate=end_date.strftime('%Y-%m-%d'),
        dimension='DATE',
        metric='EARNINGS',
      )
      data = report.execute()
      for row in data['rows']:
        date = row[0]
        revenue = row[1]
 
        record = Revenue()
        try:
          r = Revenue.objects.get(date=date)
          pk = r.id
        except Revenue.DoesNotExist:
          pk = None
        record.id = pk
        record.date = date
        record.revenue = revenue
        record.save()

为了让它能工作起来,我在浏览器打开http://localhost:8000/adsense/。这时候会要求我登录Google帐号。我为我的应用授权来访问Adsense。然后,认证证书就会保存在我的本地数据库,然后我可以调用Scraper get_report() 方法。祝贺我吧!。它能顺利工作了。

Python 相关文章推荐
Python查看多台服务器进程的脚本分享
Jun 11 Python
Python实现的多线程端口扫描工具分享
Jan 21 Python
Anaconda2 5.2.0安装使用图文教程
Sep 19 Python
Python 普通最小二乘法(OLS)进行多项式拟合的方法
Dec 29 Python
用python wxpy管理微信公众号并利用微信获取自己的开源数据
Jul 30 Python
python实现对图片进行旋转,放缩,裁剪的功能
Aug 07 Python
python的sys.path模块路径添加方式
Mar 09 Python
Numpy 理解ndarray对象的示例代码
Apr 03 Python
Python批量安装卸载1000个apk的方法
Apr 10 Python
Python加速程序运行的方法
Jul 29 Python
python中的split、rsplit、splitlines用法说明
Oct 23 Python
Python虚拟环境virtualenv是如何使用的
Jun 20 Python
在Docker上开始部署Python应用的教程
Apr 17 #Python
使用Python装饰器在Django框架下去除冗余代码的教程
Apr 16 #Python
在服务器端实现无间断部署Python应用的教程
Apr 16 #Python
使用Protocol Buffers的C语言拓展提速Python程序的示例
Apr 16 #Python
使用Python编写一个模仿CPU工作的程序
Apr 16 #Python
利用Python中的mock库对Python代码进行模拟测试
Apr 16 #Python
使用Python脚本来控制Windows Azure的简单教程
Apr 16 #Python
You might like
php 一维数组的循环遍历实现代码
2017/04/10 PHP
JSCode all of Brower 全局屏蔽网页右键功能 具体实现
2013/06/05 Javascript
js单向链表的具体实现实例
2013/06/21 Javascript
JS在TextArea光标位置插入文字并实现移动光标到文字末尾
2013/06/21 Javascript
jquery选择器-根据多个属性选择示例代码
2013/10/21 Javascript
教你在heroku云平台上部署Node.js应用
2014/07/30 Javascript
jquery取子节点及当前节点属性值的方法
2014/09/09 Javascript
JavaScript编程的单例设计模讲解
2015/11/10 Javascript
原生JS实现垂直手风琴效果
2017/02/19 Javascript
javascript DOM的详解及实例代码
2017/03/06 Javascript
canvas绘制一个常用的emoji表情
2017/03/30 Javascript
ES6知识点整理之函数对象参数默认值及其解构应用示例
2019/04/17 Javascript
微信小程序云开发修改云数据库中的数据方法
2019/05/18 Javascript
ElementUI Tree 树形控件的使用并给节点添加图标
2020/02/27 Javascript
原生JS实现烟花效果
2020/03/10 Javascript
vue与iframe之间的信息交互的实现
2020/04/08 Javascript
vue修改Element的el-table样式的4种方法
2020/09/17 Javascript
VUE Elemen-ui之穿梭框使用方法详解
2021/01/19 Javascript
Python中关于使用模块的基础知识
2015/05/24 Python
Python中模块(Module)和包(Package)的区别详解
2019/08/07 Python
jupyter notebook tensorflow打印device信息实例
2020/04/20 Python
python热力图实现简单方法
2021/01/29 Python
你不知道的葡萄干处理法、橙蜜处理法、二氧化碳酵母法
2021/03/17 冲泡冲煮
HTML5图片层叠的实现示例
2020/07/07 HTML / CSS
英国潮流网站:END.(全球免邮)
2017/01/16 全球购物
Set里的元素是不能重复的,那么用什么方法来区分重复与否呢?
2016/08/18 面试题
信息总监管理职责范本
2014/03/08 职场文书
学雷锋志愿服务月活动总结
2014/03/09 职场文书
电大毕业生自我鉴定
2014/04/10 职场文书
2014年中秋寄语
2014/08/11 职场文书
关于倡议书的范文
2015/04/29 职场文书
2015年劳动部工作总结
2015/05/23 职场文书
建党伟业的观后感
2015/06/01 职场文书
招商银行工作证明
2015/06/17 职场文书
导游词之台湾阿里山
2019/10/23 职场文书
nginx proxy_cache 缓存配置详解
2021/03/31 Servers