在做一些景象预报或者RSS订阅的程序时,每每须要抓取非本地文件,一样平常情形下都是利用php仿照浏览器的访问,通过http要求访问url地址, 然后得到html源代码或者xml数据,得到数据我们不能直接输出,每每须要对内容进行提取,然后再进行格式化,以更加友好的办法显现出来。

下面大略说一下php抓取页面的几种方法及事理:

一、 PHP抓取页面的紧张方法:

php模拟访问PHP模仿阅读器拜访抓取非当地文件的几种办法爬虫 JavaScript

1. file()函数

2. file_get_contents()函数

3. fopen()->fread()->fclose()模式

4.curl办法

5. fsockopen()函数 socket模式

6. 利用插件(如:http://sourceforge.net/projects/snoopy/)

二、PHP解析html或xml代码紧张办法:

1. file()函数

<?php $url='http://t.qq.com'; $lines_array=file($url); $lines_string=implode('',$lines_array); echo htmlspecialchars($lines_string);

2. file_get_contents()函数

利用file_get_contents和fopen必须空间开启allow_url_fopen。
方法:编辑php.ini,设置 allow_url_fopen = On,allow_url_fopen关闭时fopen和file_get_contents都不能打开远程文件。

<?php $url='http://t.qq.com'; $lines_string=file_get_contents($url); echo htmlspecialchars($lines_string);

3. fopen()->fread()->fclose()模式

<?php $url='http://t.qq.com'; $handle=fopen($url,\公众rb\"大众); $lines_string=\"大众\"大众; do{ $data=fread($handle,1024); if(strlen($data)==0) { break; } $lines_string.=$data; }while(true); fclose($handle); echo htmlspecialchars($lines_string);

4. curl办法

利用curl必须空间开启curl。
方法:windows下修正php.ini,将extension=php_curl.dll前面的分号去掉,而且需 要拷贝ssleay32.dll和libeay32.dll到C:\WINDOWS\system32下;Linux下要安装curl扩展。

<?php $url='http://t.qq.com'; $ch=curl_init(); $timeout=5; curl_setopt($ch, CURLOPT_URL, $url); curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1); curl_setopt($ch, CURLOPT_CONNECTTIMEOUT, $timeout); $lines_string=curl_exec($ch); curl_close($ch); echo htmlspecialchars($lines_string);

5. fsockopen()函数 socket模式

socket模式能否精确实行,也跟做事器的设置有关系,详细可以通过phpinfo查看做事器开启了哪些通信协议,比如我确当地php socket没开启http,只能利用udp测试一下了。

<?php $fp = fsockopen(\公众udp://127.0.0.1\公众, 13, $errno, $errstr);if (!$fp) { echo \公众ERROR: $errno - $errstr<br />\n\"大众} else { fwrite($fp, \"大众\n\"大众) echo fread($fp, 26) fclose($fp)}

如果想要学习互换PHP的朋友,可以关注