php登录网站抓取数据,php自动采集网页内容

用PHP获取网页部分数据

如果你要

成都创新互联服务项目包括青川网站建设、青川网站制作、青川网页制作以及青川网络营销策划等。多年来，我们专注于互联网行业，利用自身积累的技术优势、行业经验、深度合作伙伴关系等，向广大中小型企业、政府机构等提供互联网行业的解决方案，青川网站推广取得了明显的社会效益与经济效益。目前，我们服务的客户以成都为中心已经辐射到青川省份的部分城市，未来相信会继续扩大服务区域并继续获得客户的支持与信任！

和

之间的所有源码，用 preg_match 就可以，不用preg_match_all ，如果你要里面的所有的

标签中的内容，可以用preg_match_all //提取所有代码 $pattern = '/

(.+?)

/is'; preg_match($pattern, $string, $match); //$match[0] 即为

和

之间的所有源码 echo $match[0]; //然后再提取

之间的内容 $pattern = '/(.+?)li/is'; preg_match_all($pattern, $match[0], $results); $new_arr=array_unique($results[0]); foreach($new_arr as $kkk){ echo $kkk; }

我用PHP模拟登陆了然后抓取了数据怎么提前内容保存到数据库，看下面截图是抓取的网页数据

登陆后抓取所有的html代码。

然后通过正则匹配html标签来获取自己需要的东西，最主要的是你获取到html源码后，想要什么不就是看你需求了嘛，正则有问题可以继续问我。

phpstudy怎么抓取网页数据

什么网页数据？

是打开本地网页还是打开网上网页

如果是本地网页的话在浏览器上输入127.0.0.1或者localhost进行访问

如果是外网我理解的是你要获取外网的一个网页，可以用代码或者程序来实现

（一般称为采集程序，或者小偷程序）

//个人认为curl好一点，因为curl可以模拟浏览器，有的网站会过滤机器人

//1.php代码

//把网页读入一个字符串

$contone = file_get_contents('url');

print_r($contone);

//curl采集

#初始化curl （true/false）

$ch=curl_init();

#请求url地址

$params[CURLOPT_URL]='网址';

#是否返回响应头信息

$params[CURLOPT_HEADER] = true;

#是否将结果返回

$params[CURLOPT_RETURNTRANSFER] = true;

#是否重定向

$params[CURLOPT_FOLLOWLOCATION] = true;

#伪造浏览器

$params[CURLOPT_USERAGENT] = 'Mozilla/5.0 (Windows NT 5.1; rv:9.0.1) Gecko/20100101 Firefox/9.0.1';

curl_setopt_array($ch, $params);

$content=curl_exec($ch);

//输出网页内容

print_r($content);

//下面是整个curl采集类

class Curl{

#采集的地址

public $url;

#匹配的正则

public $preg;

#模拟登录需要的用户名

public $username;

#模拟登录需要的密码;

public $pwd;

#cookie存储的路径

private $cookie_path;

#采集数据的字符集

public $charset;

/**

* 构造方法，初始化采集基本信息

* @param $url 采集的url

* @param $preg 匹配的正则

* @param string $username 用户名

* @param string $pwd 密码

* @param string $charset 字符集

public function __construct($info){

extract($info);

$this-url=$url;

$this-preg=$preg;

if(isset($charset)){

header("content-type:text/html;charset=".$this-charset);

}else{

header("content-type:text/html;charset=utf-8");

}

if(isset($username)){

$this-username=$username;

}

if(isset($pwd)){

$this-pwd=$pwd;

}

* 采集数据，非表单提交方式，直接采集的

public function get_info(){

#初始化curl

$ch=curl_init();

#请求url地址

$params[CURLOPT_URL]=$this-url;

#是否返回响应头信息

$params[CURLOPT_HEADER] = true;

#是否将结果返回

$params[CURLOPT_RETURNTRANSFER] = true;

#是否重定向

$params[CURLOPT_FOLLOWLOCATION] = true;

#伪造浏览器

$params[CURLOPT_USERAGENT] = 'Mozilla/5.0 (Windows NT 5.1; rv:9.0.1) Gecko/20100101 Firefox/9.0.1';

//判断是否有cookie,有的话直接使用

//if (isset($_COOKIE['cookie_jar']) ($_COOKIE['cookie_jar'] || is_file($_COOKIE['cookie_jar']))){

// $params[CURLOPT_COOKIEFILE] = $_COOKIE['cookie_jar']; //这里判断cookie

//} else {

// $cookie_jar = tempnam($this-cookie_path, 'cookie'); //产生一个cookie文件

// $params[CURLOPT_COOKIEJAR] = $cookie_jar; //写入cookie信息

// setcookie('cookie_jar', $cookie_jar); //保存cookie路径

//}

#开始发送请求，传入curl参数

curl_setopt_array($ch, $params);

$content=curl_exec($ch);

preg_match_all($this-preg,$content,$arr);

return $arr;

}

/**

* 采集远程图片

* @param $img 图片路径是一个数组

* @param $save_path 图片保存在你本地的路径

* @return bool

public function get_img($img,$save_path){

for($i=0;$icount($img);$i++) {

$res=@file_get_contents($img[$i]);

$img_type=substr($img[$i], strrpos($img[$i], "."));

$path=$save_path.time().rand(1,9999999).mt_rand() .$img_type;

$img[$i] = $path;

file_put_contents($path,$res);

}

return $img;

}

//登录后采集

public function register_info(){

//采集的信息需要先登录的就要先模拟登录

//设置cookie保存路径

$ch = curl_init();

//组装用户名和密码

$info['username'] = $this-username;

$info['password'] = $this-pwd;

//模拟表单提交

$params[CURLOPT_URL] = $this-url; //请求url地址

$params[CURLOPT_HEADER] = true; //是否返回响应头信息

$params[CURLOPT_RETURNTRANSFER] = true; //是否将结果返回

$params[CURLOPT_FOLLOWLOCATION] = true; //是否重定向

$params[CURLOPT_USERAGENT] = 'Mozilla/5.0 (Windows NT 5.1; rv:9.0.1) Gecko/20100101 Firefox/9.0.1';

$postfields = '';

//将表单要提交的数据编程URL拼接方式

foreach ($info as $key = $value){

$postfields .= urlencode($key) . '=' . urlencode($value) . '';

}

$params[CURLOPT_POST] = true;

$params[CURLOPT_POSTFIELDS] = $postfields;

//判断是否有cookie,有的话直接使用

if (isset($_COOKIE['cookie_jar'])($_COOKIE['cookie_jar']||is_file($_COOKIE['cookie_jar']))){

$params[CURLOPT_COOKIEFILE] = $_COOKIE['cookie_jar']; //这里判断cookie

}else{

$cookie_jar = tempnam($this-cookie_path, 'cookie'); //产生一个cookie文件

$params[CURLOPT_COOKIEJAR] = $cookie_jar; //写入cookie信息

setcookie('cookie_jar', $cookie_jar); //保存cookie路径

}

curl_setopt_array($ch, $params); //传入curl参数

$content = curl_exec($ch); //执行

return $content;

}

php模拟windows域用户登录网站并获取数据

一般网站都是通过cookie来判断登录状态的，你可以第一次手动登录，然后把cookie保存下来。然后在用curl带上这个cookie去请求网站，就会认为你是登录的了，同时你要把新返回的cookie保存下来，这都是curl里面设置的事情，一个CURLOPT_COOKIEFILE 一个 CURLOPT_COOKIEJAR 可以说百分之九十的网站都可以这样处理

怎么用php采集网站数据

简单的分了几个步骤：

1、确定采集目标

2、获取目标远程页面内容（curl、file_get_contents）

3、分析页面html源码，正则匹配你需要的内容（preg_match、preg_match_all），这一步最为重要，不同页面正则匹配规则不一样

4、入库

PHP 模拟登陆后如何抓取分页页面信息？

curl基本特性

模拟浏览器传输数据

实现post/get方式传输

支持多种协议：HTTP、HTTPS、FTP上传

支持cookie，用户名/密码的认证

使用curl完成请求的简单步骤

初始化一个curl句柄

resource curl_init ([ string $url = NULL ] )

设置curl选项

bool curl_setopt ( resource $ch , int $option , mixed $value )

执行curl请求

mixed curl_exec ( resource $ch )

释放curl资源

void curl_close ( resource $ch )

分享文章：php登录网站抓取数据,php自动采集网页内容
文章转载：http://mswzjz.cn/article/dsijhdh.html

网站建设知识

php登录网站抓取数据,php自动采集网页内容

用PHP获取网页部分数据

我用PHP模拟登陆了然后抓取了数据怎么提前内容保存到数据库，看下面截图是抓取的网页数据

phpstudy怎么抓取网页数据

php模拟windows域用户登录网站并获取数据

怎么用php采集网站数据

PHP 模拟登陆后如何抓取分页页面信息？

其他资讯

网站建设知识

php登录网站抓取数据,php自动采集网页内容

用PHP获取网页部分数据

我用PHP模拟登陆了然后抓取了数据 怎么提前内容保存到数据库，看下面截图是抓取的网页数据

phpstudy怎么抓取网页数据

php模拟windows域用户登录网站并获取数据

怎么用php采集网站数据

PHP 模拟登陆后如何抓取分页页面信息？

其他资讯

我用PHP模拟登陆了然后抓取了数据怎么提前内容保存到数据库，看下面截图是抓取的网页数据