Google储存资讯的方式

3.1.1 Google如何建立索引

3.1.2 Google 停用词

3.1.3 Google储存索引的方式

3.1.4 Google 查询索引的方式

包含特定文字的文件清单称为纪录列表(Posting list),查找包含一个以上特定文字的文件叫做“纪录列表相交”(intersecting a post listing)。

Google搜寻引擎会执行下列工作:

所索引中找到一组包含使用者搜寻词组的网页。
将搜寻相符的网页依据重要性和相关度进行排名。

3.1.5 补充索引

引发垃圾过滤器的网页有很大的可能会直接被移除,而不会放进补充索引里
在补充索引内的网页不太可能会传回给执行搜寻的使用者,也不太可能会在搜寻结果中取得好排名。
如果网站内有很其他相似度很高的页面,就很可能放到补充索引内。
其他网站和你的网站相似度很高,但是它被引用频率高的话,你的网页有可能被放在补充索引中。
大型网站中没有足够的PageRank的网页也可能被放到补充索引内。
难以索引的网页,如网址中太多参数,网页太大,超过101k,也有可能。
补充索引内的网页会以“压缩摘要”的方式保存,所以不是网页里每个字被完整检索。

抵销补充索引影响的SEO步骤:
确认网站的结构平衡,尽量像树一样的平衡
尽量确保至少10%~15%的网站入站连结为“深度连结”,也就是连结到许多重要的内部内容或分类页
测试网站内容和其他网站的相似度。可以用网页相似度检查工具(Similar Page Checker):http://www.webconfs.com/similar-page-checker.php,如果测试失败很可能网页进入补充索引了,重新撰写网页或是配置不同网址。
确认网址中不要有太多参数,网页的大小不要超过101k。

如何查网页是否进入补充索引:

查询所有被索引的网页总数,在Google输入:site:job.achi.idv.tw
查询主索引中的网页总数,在Google网站输入:site:job.achi.idv.tw –inallurl:jobachi.idv.tw
补充索引内的网页总数 = 所有被索引的网页总数 – 主索引中的网页总数