php使用pthreads v3多线程实现抓取新浪新闻信息操作示例


Posted in PHP onFebruary 21, 2020

本文实例讲述了php使用pthreads v3多线程实现抓取新浪新闻信息。分享给大家供大家参考,具体如下:

我们使用pthreads,来写一个多线程的抓取页面小程序,把结果存到数据库里。

数据表结构如下:

CREATE TABLE `tb_sina` (
 `id` int(11) unsigned NOT NULL AUTO_INCREMENT COMMENT 'ID',
 `url` varchar(256) DEFAULT '' COMMENT 'url地址',
 `title` varchar(128) DEFAULT '' COMMENT '标题',
 `time` datetime DEFAULT NULL ON UPDATE CURRENT_TIMESTAMP COMMENT '时间',
 PRIMARY KEY (`id`)
) ENGINE=InnoDB DEFAULT CHARSET=utf8mb4 COMMENT='sina新闻';

代码如下:

<?php

class DB extends Worker
{
  private static $db;
  private $dsn;
  private $root;
  private $pwd;

  public function __construct($dsn, $root, $pwd)
  {
    $this->dsn = $dsn;
    $this->root = $root;
    $this->pwd = $pwd;
  }

  public function run()
  {
    //创建连接对象
    self::$db = new PDO($this->dsn, $this->root, $this->pwd);

    //把require放到worker线程中,不要放到主线程中,不然会报错找不到类
    require './vendor/autoload.php';
  }

  //返回一个连接资源
  public function getConn()
  {
    return self::$db;
  }
}

class Sina extends Thread
{
  private $name;
  private $url;

  public function __construct($name, $url)
  {
    $this->name = $name;
    $this->url = $url;
  }

  public function run()
  {
    $db = $this->worker->getConn();

    if (empty($db) || empty($this->url)) {
      return false;
    }

    $content = file_get_contents($this->url);
    if (!empty($content)) {
      //获取标题,地址,时间
      $data = QL\QueryList::Query($content, [
        'tit' => ['.c_tit > a', 'text'],
        'url' => ['.c_tit > a', 'href'],
        'time' => ['.c_time', 'text'],
      ], '', 'UTF-8', 'GB2312')->getData();

      //把获取的数据插入数据库
      if (!empty($data)) {
        $sql = 'INSERT INTO tb_sina(`url`, `title`, `time`) VALUES';
        foreach ($data as $row) {
          //修改下时间,新浪的时间格式是这样的04-23 15:30
          $time = date('Y') . '-' . $row['time'] . ':00';
          $sql .= "('{$row['url']}', '{$row['tit']}', '{$time}'),";
        }
        $sql = rtrim($sql, ',');
        $ret = $db->exec($sql);

        if ($ret !== false) {
          echo "线程{$this->name}成功插入{$ret}条数据\n";
        } else {
          var_dump($db->errorInfo());
        }
      }
    }
  }
}

//抓取页面地址
$url = 'http://roll.news.sina.com.cn/s/channel.php?ch=01#col=89&spec=&type=&ch=01&k=&offset_page=0&offset_num=0&num=60&asc=&page=';
//创建pool池
$pool = new Pool(5, 'DB', ['mysql:dbname=test;host=192.168.33.226', 'root', '']);

//获取100个分页数据
for ($ix = 1; $ix <= 100; $ix++) {
  $pool->submit(new Sina($ix, $url . $ix));
}

//循环收集垃圾,阻塞主线程,等待子线程结束
while ($pool->collect()) ;
$pool->shutdown();

由于使用到了QueryList,大家可以通过composer进行安装。

composer require jaeger/querylist

不过安装的版本是3.2,在我的php7.2下会有问题,由于each()已经被废弃,所以修改下源码,each()全换成foreach()就好了。

运行结果如下:

php使用pthreads v3多线程实现抓取新浪新闻信息操作示例

数据也保存进了数据库

php使用pthreads v3多线程实现抓取新浪新闻信息操作示例

当然大家也可以再次通过url,拿到具体的页面内容,这里就不做演示了,有兴趣的可以自已去实现。

希望本文所述对大家PHP程序设计有所帮助。

PHP 相关文章推荐
《PHP编程最快明白》第五讲:php目录、文件操作
Nov 01 PHP
php 数组排序 array_multisort与uasort的区别
Mar 24 PHP
php提示无法加载或mcrypt没有找到 PHP 扩展 mbstring解决办法
Mar 27 PHP
分享一下贝贝成长进度的php代码
Sep 14 PHP
php从给定url获取文件扩展名的方法
Mar 14 PHP
php技术实现加载字体并保存成图片
Jul 27 PHP
非常有用的9个PHP代码片段
Apr 06 PHP
PHP树-不需要递归的实现方法
Jun 21 PHP
php版微信公众号接口实现发红包的方法
Oct 14 PHP
Laravel 5.4重新登录实现跳转到登录前页面的原理和方法
Jul 13 PHP
为Plesk PHP7启用Oracle OCI8扩展方法总结
Mar 29 PHP
TP5框架页面跳转样式操作示例
Apr 05 PHP
php操作redis数据库常见方法实例总结
Feb 20 #PHP
php使用redis的几种常见操作方式和用法示例
Feb 20 #PHP
PHP使用openssl扩展实现加解密方法示例
Feb 20 #PHP
php使用redis的有序集合zset实现延迟队列应用示例
Feb 20 #PHP
解决windows上php xdebug 无法调试的问题
Feb 19 #PHP
laravel框架路由分组,中间件,命名空间,子域名,路由前缀实例分析
Feb 18 #PHP
laravel框架select2多选插件初始化默认选中项操作示例
Feb 18 #PHP
You might like
用PHP实现小型站点广告管理
2006/10/09 PHP
优化PHP代码的53条建议
2008/03/27 PHP
PHP+Ajax异步通讯实现用户名邮箱验证是否已注册( 2种方法实现)
2011/12/28 PHP
php Session存储到Redis的方法
2013/11/04 PHP
PHP实现求连续子数组最大和问题2种解决方法
2017/12/26 PHP
PHP中用Trait封装单例模式的实现
2019/12/18 PHP
js表格排序实例分析(支持int,float,date,string四种数据类型)
2015/05/06 Javascript
JavaScript获取当前cpu使用率的方法
2015/12/15 Javascript
jquery中ajax处理跨域的三大方式
2016/01/05 Javascript
javascript匀速运动实现方法分析
2016/01/08 Javascript
javascript构造函数以及原型对象的理解
2017/01/13 Javascript
详解使用vue实现tab 切换操作
2017/07/03 Javascript
JS如何实现在页面上快速定位(锚点跳转问题)
2017/08/14 Javascript
防止Layui form表单重复提交的实现方法
2019/09/10 Javascript
基于leaflet.js实现修改地图主题样式的流程分析
2020/05/15 Javascript
Element-ui upload上传文件限制的解决方法
2021/01/22 Javascript
jquery实现点击左右按钮切换图片
2021/01/27 jQuery
在Python3中初学者应会的一些基本的提升效率的小技巧
2015/03/31 Python
Python中利用sorted()函数排序的简单教程
2015/04/27 Python
基python实现多线程网页爬虫
2015/09/06 Python
selenium+python实现自动登录脚本
2018/04/22 Python
详解如何将python3.6软件的py文件打包成exe程序
2018/10/09 Python
python学生管理系统
2019/01/30 Python
基于python判断目录或者文件代码实例
2019/11/29 Python
Python变量作用域LEGB用法解析
2020/02/04 Python
Django搭建项目实战与避坑细节详解
2020/12/06 Python
Selenium环境变量配置(火狐浏览器)及验证实现
2020/12/07 Python
HTML5在IE10、火狐下中文乱码问题的解决方法
2013/11/18 HTML / CSS
某IT外企面试题-二分法求方程!看看大家的C++功底
2015/07/04 面试题
介绍一下Prototype的$()函数,$F()函数,$A()函数都是什么作用?
2014/03/05 面试题
《姥姥的剪纸》教学反思
2014/02/25 职场文书
大学社团活动总结
2014/04/26 职场文书
消防宣传语大全
2015/07/13 职场文书
Python-OpenCV实现图像缺陷检测的实例
2021/06/11 Python
java基础——多线程
2021/07/03 Java/Android
Python 匹配文本并在其上一行追加文本
2022/05/11 Python