PHP远程采集图片详细教程


Posted in PHP onJuly 01, 2014

当我们需要采集网络上的某个网页内容时,如果目标网站上的图片做了防盗链的话,我们直接采集过来的图片在自己网站上是不可用的。那么我们使用程序将目标网站上的图片下载到我们网站服务器上,然后就可调用图片了。

本文将使用PHP实现采集远程图片功能。基本流程:
1、获取目标网站图片地址。
2、读取图片内容。
3、创建要保存图片的路径并命名图片名称。
4、写入图片内容。
5、完成。
我们通过写几个函数来实现这一过程。
函数make_dir()建立目录。判断要保存的图片文件目录是否存在,如果不存在则创建目录,并且将目录设置为可写权限。
 

function make_dir($path){ 

    if(!file_exists($path)){//不存在则建立 

        $mk=@mkdir($path,0777); //权限 

        @chmod($path,0777); 

    } 

    return true; 

}

函数read_filetext()取得图片内容。使用fopen打开图片文件,然后fread读取图片文件内容。
function read_filetext($filepath){ 

    $filepath=trim($filepath); 

    $htmlfp=@fopen($filepath,"r"); 

    //远程 

    if(strstr($filepath,"://")){ 

        while($data=@fread($htmlfp,500000)){ 

            $string.=$data; 

        } 

    } 

    //本地 

    else{ 

        $string=@fread($htmlfp,@filesize($filepath)); 

    } 

    @fclose($htmlfp); 

    return $string; 

}

函数write_filetext()写文件,将图片内容fputs写入文件中,即保存图片文件。
function write_filetext($filepath,$string){ 

    //$string=stripSlashes($string); 

    $fp=@fopen($filepath,"w"); 

    @fputs($fp,$string); 

    @fclose($fp); 

}

函数get_filename()获取图片名称,也可以自定义要保存的文件名。
function get_filename($filepath){ 

    $fr=explode("/",$filepath); 

    $count=count($fr)-1; 

    return $fr[$count]; 

}

然后将几个函数组合,在函数save_pic()中调用,最后返回保存后的图片路径。
function save_pic($url,$savepath=''){ 

    //处理地址 

    $url=trim($url); 

    $url=str_replace(" ","%20",$url); 

    //读文件 

    $string=read_filetext($url); 

    if(empty($string)){ 

        echo '读取不了文件';exit; 

    } 

    //文件名 

    $filename = get_filename($url); 

    //存放目录 

    make_dir($savepath); //建立存放目录 

    //文件地址 

    $filepath = $savepath.$filename; 

    //写文件 

    write_filetext($filepath,$string); 

    return $filepath; 

}

最后一步就是调用save_pic()函数保存图片,我们使用以下代码做测试。
//目标图片地址 

$pic = "http://img0.pconline.com.cn/pconline/1205/06/2776119_end1_thumb.jpg"; 

//保存目录 

$savepath = "images/"; 

echo save_pic($pic,$savepath);

实际应用中,我们可能会采集某个站点的内容,比如产品信息,包括采集防盗链的图片保存到网站上服务器上。这时我们可以使用正则匹配页面内容,将页面中相匹配的图片都找出来,然后分别下载到网站服务器上,完成图片的采集。以下代码仅供测试:
function get_pic($cont,$path){ 

    $pattern_src = '/<[img|IMG].*?src=[\'|\"](.*?(?:[\.gif|\.jpg]))[\'|\"].*?[\/]?>/'; 

    $num = preg_match_all($pattern_src, $cont, $match_src); 

    $pic_arr = $match_src[1]; //获得图片数组 

    foreach ($pic_arr as $pic_item) { //循环取出每幅图的地址 

        save_pic($pic_item,$path); //下载并保存图片 

        echo "[OK]..!"; 

    } 

}

然后我们通过分析页面内容,将主体内容找出来,调用get_pic()实现图片的保存。
//我们采集太平洋电脑网上一篇关于手机报道内容页的图片 

$url = "http://gz.pconline.com.cn/321/3215791.html"; 

 

$content = file_get_contents($url);//获取网页内容 

$preg = '#<div class="art_con">(.*)<div class="ivy620 ivy620Ex"></div>#iUs'; 

preg_match_all($preg, $content, $arr); 

$cont = $arr[1][0];  

get_pic($cont,'img/');

以上代码笔者亲测,可以采集图片,但是还有些场景没考虑进去,比如目标网站做了302多次跳转的,目标网站做了多种防采集的,留给喜欢折腾的同学去试试吧。
PHP 相关文章推荐
从C/C++迁移到PHP——判断字符类型的函数
Oct 09 PHP
关于url地址传参数时字符串有回车造成页面脚本赋值失败的解决方法
Jun 28 PHP
PHP基于MySQL数据库实现对象持久层的方法
Jun 17 PHP
php使用Header函数,PHP_AUTH_PW和PHP_AUTH_USER做用户验证
May 04 PHP
ECSHOP完美解决Deprecated: preg_replace()报错的问题
May 17 PHP
PHP生成制作验证码的简单实例
Jun 12 PHP
Centos PHP 扩展Xchche的安装教程
Jul 09 PHP
PHP通过CURL实现定时任务的图片抓取功能示例
Oct 03 PHP
yii2 resetful 授权验证详解
May 18 PHP
PHP检查网站是否宕机的方法示例
Jul 24 PHP
在Laravel5.6中使用Swoole的协程数据库查询
Jun 15 PHP
浅谈如何提高PHP代码的质量
May 28 PHP
PHP实现的汉字拼音转换和公历农历转换类及使用示例
Jul 01 #PHP
PHP和javascript常用正则表达式及用法实例
Jul 01 #PHP
PHP生成二维码的两个方法和实例
Jul 01 #PHP
PHP中使用TCPDF生成PDF文档实例
Jul 01 #PHP
PHP中使用CURL模拟登录并获取数据实例
Jul 01 #PHP
2个比较经典的PHP加密解密函数分享
Jul 01 #PHP
PHP实现生成唯一编号(36进制的不重复编号)
Jul 01 #PHP
You might like
PHP编程入门的基本语法知识点总结
2016/01/26 PHP
PHP基于curl后台远程登录正方教务系统的方法
2016/10/14 PHP
PHP 观察者模式深入理解与应用分析
2019/09/25 PHP
一个js封装的不错的选项卡效果代码
2008/02/15 Javascript
让JavaScript 轻松支持函数重载 (Part 1 - 设计)
2009/08/04 Javascript
javascript奇异的arguments分析
2010/10/20 Javascript
javascript 事件绑定问题
2011/01/01 Javascript
分享27款非常棒的jQuery 表单插件
2011/03/28 Javascript
jQuery.extend 函数的详细用法
2012/06/27 Javascript
AMD异步模块定义介绍和Require.js中使用jQuery及jQuery插件的方法
2014/06/06 Javascript
jQuery获取页面元素绝对与相对位置的方法
2015/06/10 Javascript
值得分享的轻量级Bootstrap Table表格插件
2016/05/30 Javascript
BootStrap智能表单demo示例详解
2016/06/13 Javascript
AngularJS基础 ng-keypress 指令简单示例
2016/08/02 Javascript
NodeJS创建最简单的HTTP服务器
2017/05/15 NodeJs
bootstrap轮播模板使用方法详解
2017/11/17 Javascript
JS实现手风琴特效
2020/11/08 Javascript
python实现下载指定网址所有图片的方法
2015/08/08 Python
python代码 FTP备份交换机配置脚本实例解析
2019/08/01 Python
python解析命令行参数的三种方法详解
2019/11/29 Python
HTML5 实战PHP之Web页面表单设计
2011/10/09 HTML / CSS
Marriott中国:万豪国际酒店查询预订
2016/09/02 全球购物
META-INF文件夹中的MANIFEST.MF的作用
2016/06/21 面试题
预备党员的自我评价
2014/03/12 职场文书
电话客服专员岗位职责
2014/06/28 职场文书
2014年教师党员自我评价范文
2014/09/22 职场文书
个人股份合作协议书
2014/10/24 职场文书
工作表扬信
2015/01/17 职场文书
介绍信如何写
2015/01/31 职场文书
2015年保送生自荐信
2015/03/24 职场文书
征求意见函
2015/06/05 职场文书
同乡会致辞
2015/07/30 职场文书
学校食堂管理制度
2015/08/04 职场文书
服装店员工管理制度
2015/08/07 职场文书
解决golang 关于全局变量的坑
2021/05/06 Golang
vue3使用vuedraggable实现拖拽功能
2022/04/06 Vue.js