PHP實現簡單爬蟲的方法

4年以前  |  閱讀數:1688 次  |  編程語言:PHP   |    

本文實例講述了PHP實現簡單爬蟲的方法。分享給大家供大家參考。具體如下:


    <?php
    /**
     * 爬蟲程序 -- 原型
     *
     * 從給定的url獲取html內容
     * 
     * @param string $url 
     * @return string 
     */
    function _getUrlContent($url) {
      $handle = fopen($url, "r");
      if ($handle) {
        $content = stream_get_contents($handle, 1024 * 1024);
        return $content;
      } else {
        return false;
      } 
    } 
    /**
     * 從html內容中篩選鏈接
     * 
     * @param string $web_content 
     * @return array 
     */
    function _filterUrl($web_content) {
      $reg_tag_a = '/<[a|A].*?href=[\'\"]{0,1}([^>\'\"\ ]*).*?>/';
      $result = preg_match_all($reg_tag_a, $web_content, $match_result);
      if ($result) {
        return $match_result[1];
      } 
    } 
    /**
     * 修正相對路徑
     * 
     * @param string $base_url 
     * @param array $url_list 
     * @return array 
     */
    function _reviseUrl($base_url, $url_list) {
      $url_info = parse_url($base_url);
      $base_url = $url_info["scheme"] . '://';
      if ($url_info["user"] && $url_info["pass"]) {
        $base_url .= $url_info["user"] . ":" . $url_info["pass"] . "@";
      } 
      $base_url .= $url_info["host"];
      if ($url_info["port"]) {
        $base_url .= ":" . $url_info["port"];
      } 
      $base_url .= $url_info["path"];
      print_r($base_url);
      if (is_array($url_list)) {
        foreach ($url_list as $url_item) {
          if (preg_match('/^http/', $url_item)) {
            // 已經是完整的url
            $result[] = $url_item;
          } else {
            // 不完整的url
            $real_url = $base_url . '/' . $url_item;
            $result[] = $real_url;
          } 
        } 
        return $result;
      } else {
        return;
      } 
    } 
    /**
     * 爬蟲
     * 
     * @param string $url 
     * @return array 
     */
    function crawler($url) {
      $content = _getUrlContent($url);
      if ($content) {
        $url_list = _reviseUrl($url, _filterUrl($content));
        if ($url_list) {
          return $url_list;
        } else {
          return ;
        } 
      } else {
        return ;
      } 
    } 
    /**
     * 測試用主程序
     */
    function main() {
      $current_url = "http://hao123.com/"; //初始url
      $fp_puts = fopen("url.txt", "ab"); //記錄url列表
      $fp_gets = fopen("url.txt", "r"); //保存url列表
      do {
        $result_url_arr = crawler($current_url);
        if ($result_url_arr) {
          foreach ($result_url_arr as $url) {
            fputs($fp_puts, $url . "\r\n");
          } 
        } 
      } while ($current_url = fgets($fp_gets, 1024)); //不斷獲得url
    } 
    main();
    ?>

希望本文所述對大家的php程序設計有所幫助。

 相關文章:
SSH 登錄失?。篐ost key verification failed
將二進制數據轉為16進制以便顯示
PHP分頁顯示制作詳細講解
獲取IMSI
獲取IMEI
Java生成UUID
PHP自定義函數獲取搜索引擎來源關鍵字的方法
在Zeus Web Server中安裝PHP語言支持
指定應用ID以獲取對應的應用名稱
讓你成為最歷害的git提交人
再談PHP中單雙引號的區別詳解
Python 2與Python 3版本和編碼的對比
PHP實現簡單爬蟲的方法
php+ajax+json 詳解及實例代碼
wget使用技巧
php封裝的page分頁類完整實例
php數組合并array_merge()函數使用注意事項
php實現數組中索引關聯數據轉換成json對象的方法
桌面中心(一)創建數據庫
Yii2漢字轉拼音類的實例代碼
18禁止午夜福利体验区,人与动人物xxxx毛片人与狍,色男人窝网站聚色窝,女生把筷子放屁眼里,国产精品久久久,国产日产欧洲无码视频