
正文
php正则采集网页数据 php正则url
提示:扫一扫查出行【扫一扫了解最新限行尾号】
复制提示
php正则表达式怎么抓取网页数据
会用正则就会抓取。
不会正则,一时半会也教不错。
不过,推荐你使用phpQuery这个框架,用jQuery的使用器来抓取数据。
相关问答
Q1: PHP如何正则表达式提取网页内容
如果你要div class="nav" monkey="nav"和div class="head-ad"之间的所有源码,用 preg_match 就可以,不用preg_match_all ,如果你要里面的所有的 li/li标签中的内容,可以用preg_match_all
//提取所有代码
$pattern = '/div class="nav" monkey="nav"(.+?)div class="head-ad"/is';
preg_match($pattern, $string, $match);
//$match[0] 即为div class="nav" monkey="nav"和div class="head-ad"之间的所有源码
echo $match[0];
//然后再提取li/li之间的内容
$pattern = '/li.*?(.+?)\/li/is';
preg_match_all($pattern, $match[0], $results);
$new_arr=array_unique($results[0]);
foreach($new_arr as $kkk){
echo $kkk;
}
Q2: 怎么用php采集网站数据
简单的分了几个步骤:
1、确定采集目标
2、获取目标远程页面内容(curl、file_get_contents)
3、分析页面html源码,正则匹配你需要的内容(preg_match、preg_match_all),这一步最为重要,不同页面正则匹配规则不一样
4、入库
Q3: php 正则获取网站内容
我写好了,用Dreamweaver调试过,可以匹配。
先用下面正则提取需要的代码段:
Draw Result.+?(\d{1,2})/td.+?(\d{1,2})/td.+?(\d{1,2})/td.+?(\d{1,2})/td.+?(\d{1,2})/td.+?(\d{1,2})/td
再用正则替换,把该内容中除了数字以外的代码去除:
替换成$1,$2,$3,$4,$5,$6 即可得到 4,7,8,33,36,43
php正则采集网页数据的介绍就聊到这里吧,感谢你花时间阅读本站内容,更多关于php正则url、php正则采集网页数据的信息别忘了在本站进行查找喔。






