网页一般由三部分组成,分别是 HTML(超文本标记语言)、CSS(层叠样式表)和 JScript(活动脚本语言)
- HTML
HTML 是整个网页的结构,相当于整个网站的框架。带“<”、“>”符号的都是属于 HTML 的标签,并且标签都是成对出现的。
常见的标签如下:
<html>..</html> 表示标记中间的元素是网页
<body>..</body> 表示用户可见的内容
<div>..</div> 表示框架
<p>..</p> 表示段落
<li>..</li>表示列表
<img>..</img>表示图片
<h1>..</h1>表示标题
>..</a>表示超链接
- CSS
CSS 表示样式,<style type="text/css">表示下面引用一个 CSS,在 CSS 中定义了外观。
- JScript
JScript表示功能。交互的内容和各种特效都在 JScript 中,JScript 描述了网站中的各种功能。
爬虫的合法性
- robots.txt
几乎每一个网站都有一个名为 robots.txt 的文档,当然也有部分网站没有设定 robots.txt。对于没有设定 robots.txt 的网站可以通过网络爬虫获取没有口令加密的数据,也就是该网站所有页面数据都可以爬取。如果网站有 robots.txt 文档,就要判断是否有禁止访客获取的数据。
想要查看robots.txt,在浏览器中访问 https://想要访问的网址/robots.txt即可。
User-Agent:*
Disallow:/
上文意思是除前面代码指定的爬虫外,不允许其他爬虫爬取任何数据。
标签:网页,..,认识,爬虫,robots,JScript,txt,CSS From: https://www.cnblogs.com/ortas/p/17375459.html