php抓取并保存网站图片的实现代码

5年以前  |  阅读数:1201 次  |  编程语言:PHP 

此程序实现了网页源代码捕获,图片链接获取、分析、并将同样的图片链接合并功能,实现了图片抓取功能。利用php强大的网络内容处理函数将指定的网站上的所有图片抓取下来,保存在当前目录下,以下为代码:


    <?php 
    /*完成网页内容捕获功能*/ 
    function get_img_url($site_name){ 
     $site_fd = fopen($site_name, "r"); 
     $site_content = ""; 
     while (!feof($site_fd)) { 
      $site_content .= fread($site_fd, 1024); 
     } 
     /*利用正则表达式得到图片链接*/ 
     $reg_tag = '/<img.*?\"([^\"]*(jpg|bmp|jpeg|gif)).*?>/'; 
     $ret = preg_match_all($reg_tag, $site_content, $match_result); 
     fclose($site_fd); 
     return $match_result[1]; 
    } 

    /* 对图片链接进行修正 */ 
    function revise_site($site_list, $base_site){ 
     foreach($site_list as $site_item) { 
      if (preg_match('/^http/', $site_item)) { 
       $return_list[] = $site_item; 
      }else{ 
       $return_list[] = $base_site."/".$site_item; 
     } 
     } 
     return $return_list; 
    } 

    /*得到图片名字,并将其保存在指定位置*/ 
    function get_pic_file($pic_url_array, $pos){ 
     $reg_tag = '/.*\/(.*?)$/'; 
     $count = 0; 
     foreach($pic_url_array as $pic_item){ 
      $ret = preg_match_all($reg_tag,$pic_item,$t_pic_name); 
      $pic_name = $pos.$t_pic_name[1][0]; 
      $pic_url = $pic_item; 
     print("Downloading ".$pic_url." "); 
      $img_read_fd = fopen($pic_url,"r"); 
      $img_write_fd = fopen($pic_name,"w"); 
      $img_content = ""; 
      while(!feof($img_read_fd)){ 
       $img_content .= fread($img_read_fd,1024); 

      } 
      fwrite($img_write_fd,$img_content); 
      fclose($img_read_fd); 
      fclose($img_write_fd); 
      print("[OK] "); 
     } 
     return 0; 
    } 

    function main(){ 
    /* 待抓取图片的网页地址 */ 
     $site_name = "http://www.jb51.net/sheying/391528.html"; 
     $img_url = get_img_url($site_name); 
     $img_url_revised = revise_site($img_url, $site_name); 
     $img_url_unique = array_unique($img_url_revised); //unique array 
     get_pic_file($img_url_unique,"./"); 
    } 

    main(); 
    ?> 

此程序还有待完善的地方是,如果图片在网站服务器上不同目录下但文件名是相同的,此时图片有可能是不一样的,但在最后保存时,后面得到的图片会将前面已经保存的图片覆盖掉,解决方法是在每次保存前先检索当前目录下是否已有此文件名,有的话对将要保存的图片重新命名即可。

以上就是为大家分享的php抓取并保存网站图片的方法,以及在实践过程中修正程序不完善的地方,希望这篇文章对大家的学习有所帮助。

 相关文章:
PHP分页显示制作详细讲解
SSH 登录失败:Host key verification failed
获取IMSI
将二进制数据转为16进制以便显示
获取IMEI
文件下载
贪吃蛇
双位运算符
PHP自定义函数获取搜索引擎来源关键字的方法
Java生成UUID
发送邮件
年的日历图
提取后缀名
在Zeus Web Server中安装PHP语言支持
让你成为最历害的git提交人
Yii2汉字转拼音类的实例代码
再谈PHP中单双引号的区别详解
指定应用ID以获取对应的应用名称
Python 2与Python 3版本和编码的对比
php封装的page分页类完整实例