在做一些景象预报或者RSS订阅的程序时,每每须要抓取非本地文件,一样平常情形下都是利用php仿照浏览器的访问,通过http要求访问url地址, 然后得到html源代码或者xml数据,得到数据我们不能直接输出,每每须要对内容进行提取,然后再进行格式化,以更加友好的办法显现出来。
下面大略说一下php抓取页面的几种方法及事理:
一、 PHP抓取页面的紧张方法:
1. file()函数
2. file_get_contents()函数
3. fopen()->fread()->fclose()模式
4.curl办法
5. fsockopen()函数 socket模式
6. 利用插件(如:http://sourceforge.net/projects/snoopy/)
二、PHP解析html或xml代码紧张办法:
1. file()函数
<?php $url='http://t.qq.com'; $lines_array=file($url); $lines_string=implode('',$lines_array); echo htmlspecialchars($lines_string);
2. file_get_contents()函数
利用file_get_contents和fopen必须空间开启allow_url_fopen。方法:编辑php.ini,设置 allow_url_fopen = On,allow_url_fopen关闭时fopen和file_get_contents都不能打开远程文件。
<?php $url='http://t.qq.com'; $lines_string=file_get_contents($url); echo htmlspecialchars($lines_string);
3. fopen()->fread()->fclose()模式
<?php $url='http://t.qq.com'; $handle=fopen($url,\公众rb\"大众); $lines_string=\公众\公众; do{ $data=fread($handle,1024); if(strlen($data)==0) { break; } $lines_string.=$data; }while(true); fclose($handle); echo htmlspecialchars($lines_string);
4. curl办法
利用curl必须空间开启curl。方法:windows下修正php.ini,将extension=php_curl.dll前面的分号去掉,而且需 要拷贝ssleay32.dll和libeay32.dll到C:\WINDOWS\system32下;Linux下要安装curl扩展。
<?php $url='http://t.qq.com'; $ch=curl_init(); $timeout=5; curl_setopt($ch, CURLOPT_URL, $url); curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1); curl_setopt($ch, CURLOPT_CONNECTTIMEOUT, $timeout); $lines_string=curl_exec($ch); curl_close($ch); echo htmlspecialchars($lines_string);
5. fsockopen()函数 socket模式
socket模式能否精确实行,也跟做事器的设置有关系,详细可以通过phpinfo查看做事器开启了哪些通信协议,比如我确当地php socket没开启http,只能利用udp测试一下了。
<?php $fp = fsockopen(\"大众udp://127.0.0.1\"大众, 13, $errno, $errstr);if (!$fp) { echo \"大众ERROR: $errno - $errstr<br />\n\"大众} else { fwrite($fp, \"大众\n\公众) echo fread($fp, 26) fclose($fp)}
如果想要学习互换PHP的朋友,可以关注