自己动手编写CSDN博客备份工具-blogspider

来源：https://blog.csdn.net/gzshun

我之前一直在看lucene，nutch，发现有这么一个现成的小应用，特转来学习下！mark一下。

网络爬虫（又被称为网页蜘蛛，网络机器人），是一种按照一定的规则，自动的抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁，自动索引，模拟程序或者蠕虫。

网络爬虫最重要的任务，就是从互联网搜索出需要的信息，将网页抓取下来并分析，很多搜索引擎，比如百度，谷歌，后台都有一只很强悍的网络爬虫，用来访问互联网上的网页，图片，视频等内容，并建立索引数据库，使用户能在百度搜索引擎中搜索到您网站的网页、图片、视频等内容。

我们常见的几个大型搜索引擎公司的爬虫名称：
1.谷歌（Google） -> Googlebot
2.百度（Baidu）爬虫名称：Baiduspider
3.雅虎（Yahoo） -> Yahoo! Slurp
4.有道（Yodao） -> YodaoBot
5.搜狗（sogou） -> Sogou spider
6.MSN -> msmbot
7.腾讯搜搜 -> Sosospider

最近我突然想自己动手写一只小型的博客爬虫，将自己在CSDN博客网站写的文章给抓取下来，想做个博客备份工具。当了解到网络爬虫的用途后，就来动手实现一个应用，用来备份自己在CSDN的博客，这样即使没有网络，或者文章丢失了，我手头都有一个备份。记得上次在微博看过CSDN创始人蒋涛先生说的一句话，他想做一个CSDN博客生成PDF文档的工具，其实那也相当于对自己博客的备份，这样就能很方便的浏览自己的写的文章。

我写的这个"blogspider"程序，将会把自己博客信息提取出来，并将所有的文章下载到本地。这里只是简单的下载网页而已，里面的图片我没有下载，那得涉及到太多的东西。如果电脑有网络，将会很容易的看到博客里面的图片，如果没有网络，图片将无法显示。

blogspider程序由C语言编写的，基于Linux平台，我编写该程序的环境如下：

[plain] view plain copy

gzshun@ubuntu:~$ uname -a
Linux ubuntu 2.6.32-24-generic-pae #39-Ubuntu SMP Wed Jul 28 07:39:26 UTC 2010 i686 GNU/Linux
gzshun@ubuntu:~$ gcc -v
Using built-in specs.
Target: i486-linux-gnu
Configured with: ../src/configure -v --with-pkgversion='Ubuntu 4.4.3-4ubuntu5' --with-bugurl=file:///usr/share/doc/gcc-4.4/README.Bugs --enable-languages=c,c++,fortran,objc,obj-c++ --prefix=/usr --enable-shared --enable-multiarch --enable-linker-build-id --with-system-zlib --libexecdir=/usr/lib --without-included-gettext --enable-threads=posix --with-gxx-include-dir=/usr/include/c++/4.4 --program-suffix=-4.4 --enable-nls --enable-clocale=gnu --enable-libstdcxx-debug --enable-plugin --enable-objc-gc --enable-targets=all --disable-werror --with-arch-32=i486 --with-tune=generic --enable-checking=release --build=i486-linux-gnu --host=i486-linux-gnu --target=i486-linux-gnu
Thread model: posix
gcc version 4.4.3 (Ubuntu 4.4.3-4ubuntu5)

本人在putty终端测试程序，可以正确的显示中文，要设置为UTF-8，或者GB2312，如果显示乱码，切换一下字符集试试。

一.blogspider的功能简介：

1.获取博客的基本信息:
博客标题
博客访问量
博客积分
博客排名
博客原创文章数量
博客转载文章数量
博客译文文章数量
博客评论数量

2.下载博客到本地:
博客主题
博客发表日期
博客阅读次数
博客评论次数

二.blogspider涉及到的知识点:
1.文件I/O
2.网络编程socket
3.数据结构-链表
4.内存分配

三.blogspider程序执行流程:
以我的博客为例：
1.将"https://blog.csdn.net/gzshun"主页下载到本地
2.分析该主页，获取到博客的URL
3.将博客的URL添加到爬虫链表
4.遍历爬虫链表，将博客下载到本地
5.将下载日志保存在gzshun.log

四.blogspider程序的重要部分:

1.爬虫链表的结构体

自己动手编写CSDN博客备份工具-blogspider

上一篇： 各大网站收录入口| 各大搜索引擎提交 | 搜索引擎提交地址

下一篇： iPhone上安装Android系统详细步骤

相关内容

热门内容

最新内容

上一篇：各大网站收录入口| 各大搜索引擎提交 | 搜索引擎提交地址