PHP远程采集图片详细教程


Posted in PHP onJuly 01, 2014

当我们需要采集网络上的某个网页内容时,如果目标网站上的图片做了防盗链的话,我们直接采集过来的图片在自己网站上是不可用的。那么我们使用程序将目标网站上的图片下载到我们网站服务器上,然后就可调用图片了。

本文将使用PHP实现采集远程图片功能。基本流程:
1、获取目标网站图片地址。
2、读取图片内容。
3、创建要保存图片的路径并命名图片名称。
4、写入图片内容。
5、完成。
我们通过写几个函数来实现这一过程。
函数make_dir()建立目录。判断要保存的图片文件目录是否存在,如果不存在则创建目录,并且将目录设置为可写权限。
 

function make_dir($path){ 

    if(!file_exists($path)){//不存在则建立 

        $mk=@mkdir($path,0777); //权限 

        @chmod($path,0777); 

    } 

    return true; 

}

函数read_filetext()取得图片内容。使用fopen打开图片文件,然后fread读取图片文件内容。
function read_filetext($filepath){ 

    $filepath=trim($filepath); 

    $htmlfp=@fopen($filepath,"r"); 

    //远程 

    if(strstr($filepath,"://")){ 

        while($data=@fread($htmlfp,500000)){ 

            $string.=$data; 

        } 

    } 

    //本地 

    else{ 

        $string=@fread($htmlfp,@filesize($filepath)); 

    } 

    @fclose($htmlfp); 

    return $string; 

}

函数write_filetext()写文件,将图片内容fputs写入文件中,即保存图片文件。
function write_filetext($filepath,$string){ 

    //$string=stripSlashes($string); 

    $fp=@fopen($filepath,"w"); 

    @fputs($fp,$string); 

    @fclose($fp); 

}

函数get_filename()获取图片名称,也可以自定义要保存的文件名。
function get_filename($filepath){ 

    $fr=explode("/",$filepath); 

    $count=count($fr)-1; 

    return $fr[$count]; 

}

然后将几个函数组合,在函数save_pic()中调用,最后返回保存后的图片路径。
function save_pic($url,$savepath=''){ 

    //处理地址 

    $url=trim($url); 

    $url=str_replace(" ","%20",$url); 

    //读文件 

    $string=read_filetext($url); 

    if(empty($string)){ 

        echo '读取不了文件';exit; 

    } 

    //文件名 

    $filename = get_filename($url); 

    //存放目录 

    make_dir($savepath); //建立存放目录 

    //文件地址 

    $filepath = $savepath.$filename; 

    //写文件 

    write_filetext($filepath,$string); 

    return $filepath; 

}

最后一步就是调用save_pic()函数保存图片,我们使用以下代码做测试。
//目标图片地址 

$pic = "http://img0.pconline.com.cn/pconline/1205/06/2776119_end1_thumb.jpg"; 

//保存目录 

$savepath = "images/"; 

echo save_pic($pic,$savepath);

实际应用中,我们可能会采集某个站点的内容,比如产品信息,包括采集防盗链的图片保存到网站上服务器上。这时我们可以使用正则匹配页面内容,将页面中相匹配的图片都找出来,然后分别下载到网站服务器上,完成图片的采集。以下代码仅供测试:
function get_pic($cont,$path){ 

    $pattern_src = '/<[img|IMG].*?src=[\'|\"](.*?(?:[\.gif|\.jpg]))[\'|\"].*?[\/]?>/'; 

    $num = preg_match_all($pattern_src, $cont, $match_src); 

    $pic_arr = $match_src[1]; //获得图片数组 

    foreach ($pic_arr as $pic_item) { //循环取出每幅图的地址 

        save_pic($pic_item,$path); //下载并保存图片 

        echo "[OK]..!"; 

    } 

}

然后我们通过分析页面内容,将主体内容找出来,调用get_pic()实现图片的保存。
//我们采集太平洋电脑网上一篇关于手机报道内容页的图片 

$url = "http://gz.pconline.com.cn/321/3215791.html"; 

 

$content = file_get_contents($url);//获取网页内容 

$preg = '#<div class="art_con">(.*)<div class="ivy620 ivy620Ex"></div>#iUs'; 

preg_match_all($preg, $content, $arr); 

$cont = $arr[1][0];  

get_pic($cont,'img/');

以上代码笔者亲测,可以采集图片,但是还有些场景没考虑进去,比如目标网站做了302多次跳转的,目标网站做了多种防采集的,留给喜欢折腾的同学去试试吧。
PHP 相关文章推荐
使用adodb lite解决问题
Dec 31 PHP
使用PHPMyAdmin修复论坛数据库的图文方法
Jan 09 PHP
header跳转和include包含问题详解
Sep 08 PHP
解析PHP的session过期设置
Jun 29 PHP
php遍历文件夹所有文件子文件夹函数代码
Nov 27 PHP
PHP实现将textarea的值根据回车换行拆分至数组
Jun 10 PHP
降低PHP Redis内存占用
Mar 23 PHP
PHP简单实现记录网站访问量功能示例
Jun 06 PHP
PHP中soap用法示例【SoapServer服务端与SoapClient客户端编写】
Dec 25 PHP
gearman管理工具GearmanManager的安装与php使用方法示例
Feb 27 PHP
php模拟post提交请求调用接口示例解析
Aug 07 PHP
如何在Mac上通过docker配置PHP开发环境
May 29 PHP
PHP实现的汉字拼音转换和公历农历转换类及使用示例
Jul 01 #PHP
PHP和javascript常用正则表达式及用法实例
Jul 01 #PHP
PHP生成二维码的两个方法和实例
Jul 01 #PHP
PHP中使用TCPDF生成PDF文档实例
Jul 01 #PHP
PHP中使用CURL模拟登录并获取数据实例
Jul 01 #PHP
2个比较经典的PHP加密解密函数分享
Jul 01 #PHP
PHP实现生成唯一编号(36进制的不重复编号)
Jul 01 #PHP
You might like
PHP在引号前面添加反斜杠(PHP去除反斜杠)
2013/09/28 PHP
PHP+Mysql树型结构(无限分类)数据库设计的2种方式实例
2014/07/15 PHP
深入理解PHP中的global
2014/08/19 PHP
php开启与关闭错误提示适用于没有修改php.ini的权限
2014/10/16 PHP
Laravel接收前端ajax传来的数据的实例代码
2017/07/20 PHP
php多进程应用场景实例详解
2019/07/22 PHP
javascript字典探测用户名工具
2006/10/05 Javascript
Javascript实现CheckBox的全选与取消全选的代码
2010/07/20 Javascript
JavaScript初学者需要了解10个小技巧
2010/08/25 Javascript
javascript Window及document对象详细整理
2011/01/12 Javascript
js调用后台servlet方法实例
2013/06/09 Javascript
javascript history对象(历史记录)使用方法(实现浏览器前进后退)
2014/01/07 Javascript
parentElement,srcElement的使用小结
2014/01/13 Javascript
当达到输入长度时表单自动切换焦点
2014/04/06 Javascript
一个JavaScript防止表单重复提交的实例
2014/10/21 Javascript
js中iframe调用父页面的方法
2014/10/30 Javascript
Js使用WScript.Shell对象执行.bat文件和cmd命令
2014/12/18 Javascript
JavaScript实现向setTimeout执行代码传递参数的方法
2015/04/16 Javascript
png在IE6 下无法透明的解决方法汇总
2015/05/21 Javascript
javascript 常见功能汇总
2015/06/11 Javascript
JavaScript中的this引用(推荐)
2016/08/05 Javascript
微信小程序开发(二)图片上传+服务端接收详解
2017/01/11 Javascript
vue父组件中获取子组件中的数据(实例讲解)
2017/09/27 Javascript
webstorm中vue语法的支持详解
2018/05/09 Javascript
原来JS还可以这样拆箱转换详解
2019/02/01 Javascript
详解微信小程序(Taro)手动埋点和自动埋点的实现
2021/03/02 Javascript
通过Py2exe将自己的python程序打包成.exe/.app的方法
2018/05/26 Python
python itchat实现调用微信接口的第三方模块方法
2019/06/11 Python
Python django框架输入汉字,数字,字符生成二维码实现详解
2019/09/24 Python
PyQt5 文本输入框自动补全QLineEdit的实现示例
2020/05/13 Python
什么是Python中的匿名函数
2020/06/02 Python
大学信息公开实施方案
2014/03/09 职场文书
公务员党的群众路线教育实践活动学习心得体会
2014/10/30 职场文书
鲁滨逊漂流记读书笔记
2015/06/26 职场文书
前端JavaScript大管家 package.json
2021/11/02 Javascript
Win10多屏显示如何设置?Win10电脑多屏显示设置操作方法
2022/07/07 数码科技