搜索引擎分类搜索引擎按其工作方式主要可分为三种,分别是全文搜索引擎(Full Text Search Engine)、 目录索引类搜索引擎(Search Index/Directory)和元搜索引擎(Meta Search Engine))•全文搜索引擎全文搜索引擎是名副其实的搜索引擎,国外具代表性的有Google、Fast/AllTheWeb、AltaVista、 Inktomi、Teoma、WiseNut等,国内著名的有百度(Baidu)它们都是通过从互联网上提取 的各个网站的信息(以网页文字为主)而建立的数据库中,检索与用户查询条件匹配的相关 记录,然后按一定的排列顺序将结果返回给用户,因此他们是真正的搜索引擎从搜索结果来源的角度,全文搜索引擎又可细分为两种,一种是拥有自己的检索程序(Indexer),俗称“蜘蛛”(Spider)程序或“机器人”(Robot)程序,并自建网页数据库, 搜索结果直接从自身的数据库中调用,如上面提到的 7 家引擎;另一种则是租用其他引擎的 数据库,并按自定的格式排列搜索结果,如Lycos引擎• 目录索引目录索引虽然有搜索功能,但在严格意义上算不上是真正的搜索引擎,仅仅是按目录分类的 网站链接列表而已。
用户完全可以不用进行关键词(Keywords)查询,仅靠分类目录也可 找到需要的信息目录索引中最具代表性的莫过于大名鼎鼎的 Yahoo 雅虎其他著名的还 有 Open Directory Project(DMOZ)、 LookSmart、 About 等国内的搜狐、新浪、网易搜索 也都属于这一类• 元搜索引擎(META Search Engine)元搜索引擎在接受用户查询请求时,同时在其他多个引擎上进行搜索,并将结果返回给用户 著名的元搜索引擎有InfoSpace、Dogpile、Vivisimo等(元搜索引擎列表),中文元搜索引擎 中具代表性的有搜星搜索引擎在搜索结果排列方面,有的直接按来源引擎排列搜索结果, 如Dogpile,有的则按自定的规则将结果重新排列组合,如Vivisimo• 除上述三大类引擎外,还有以下几种非主流形式:集合式搜索引擎:如HotBot在2002年底推出的引擎该引擎类似META搜索引擎,但区 别在于不是同时调用多个引擎进行搜索,而是由用户从提供的 4 个引擎当中选择,因此叫它 “集合式”搜索引擎更确切些门户搜索引擎:如AOL Search、MSN Search等虽然提供搜索服务,但自身即没有分类目录 也没有网页数据库,其搜索结果完全来自其他引擎。
免费链接列表(Free For All Links,简称FFA):这类网站一般只简单地滚动排列链接条目, 少部分有简单的分类目录,不过规模比起Yahoo等目录索引来要小得多由于上述网站都为用户提供搜索查询服务,为方便起见,我们通常将其统称为搜索引擎• 搜索引擎基本工作原理了解搜索引擎的工作原理对我们日常搜索应用和网站提交推广都会有很大帮助全文搜索引擎在搜索引擎分类部分我们提到过全文搜索引擎从网站提取信息建立网页数据库的概念搜索 引擎的自动信息搜集功能分两种一种是定期搜索,即每隔一段时间(比如Google 一般是 28天),搜索引擎主动派出“蜘蛛”程序,对一定IP地址范围内的互联网站进行检索,一 旦发现新的网站,它会自动提取网站的信息和网址加入自己的数据库另一种是提交网站搜索,即网站拥有者主动向搜索引擎提交网址,它在一定时间内(2天到 数月不等)定向向你的网站派出“蜘蛛”程序,扫描你的网站并将有关信息存入数据库,以 备用户查询由于近年来搜索引擎索引规则发生了很大变化,主动提交网址并不保证你的网 站能进入搜索引擎数据库,因此目前最好的办法是多获得一些外部链接,让搜索引擎有更多 机会找到你并自动将你的网站收录。
当用户以关键词查找信息时,搜索引擎会在数据库中进行搜寻,如果找到与用户要求内容相 符的网站,便采用特殊的算法——通常根据网页中关键词的匹配程度,出现的位置/频次, 链接质量等——计算出各网页的相关度及排名等级,然后根据关联度高低,按顺序将这些网 页链接返回给用户目录索引与全文搜索引擎相比,目录索引有许多不同之处首先,搜索引擎属于自动网站检索,而目录索引则完全依赖手工操作用户提交网站后,目 录编辑人员会亲自浏览你的网站,然后根据一套自定的评判标准甚至编辑人员的主观印象, 决定是否接纳你的网站其次,搜索引擎收录网站时,只要网站本身没有违反有关的规则,一般都能登录成功而目 录索引对网站的要求则高得多,有时即使登录多次也不一定成功尤其象Yahoo!这样的超 级索引,登录更是困难由于登录Yahoo!的难度最大,而它又是商家网络营销必争之地, 所以我们会在后面用专门的篇幅介绍登录Yahoo雅虎的技巧)此外,在登录搜索引擎时,我们一般不用考虑网站的分类问题,而登录目录索引时则必须将 网站放在一个最合适的目录(Directory)最后,搜索引擎中各网站的有关信息都是从用户网页中自动提取的,所以用户的角度看,我 们拥有更多的自主权;而目录索引则要求必须手工另外填写网站信息,而且还有各种各样的 限制。
更有甚者,如果工作人员认为你提交网站的目录、网站信息不合适,他可以随时对其 进行调整,当然事先是不会和你商量的目录索引,顾名思义就是将网站分门别类地存放在相应的目录中,因此用户在查询信息时, 可选择关键词搜索,也可按分类目录逐层查找如以关键词搜索,返回的结果跟搜索引擎一 样,也是根据信息关联程度排列网站,只不过其中人为因素要多一些如果按分层目录查找, 某一目录中网站的排名则是由标题字母的先后顺序决定(也有例外)目前,搜索引擎与目录索引有相互融合渗透的趋势原来一些纯粹的全文搜索引擎现在也提 供目录搜索,如 Google 就借用 Open Directory 目录提供分类查询而象 Yahoo! 这些老牌 目录索引则通过与Google等搜索引擎合作扩大搜索范围在默认搜索模式下,一些目录类 搜索引擎首先返回的是自己目录中匹配的网站,如国内搜狐、新浪、网易等;而另外一些则 默认的是网页搜索,如Yahoo搜索引擎的第三定律 搜索引擎走到今天,已经是一个结束过去,开辟未来的时候了为了说清楚我所讲的第三定 律,我们先来回顾一下第一和第二定律第一定律 相关性定律听起来象是一篇学术论文,的确,就连第一,第二定律的提法以前也没有过,但是第一,第 二定律的内容确早已在业界和学术界得到了公认。
其实这第一定律是早在互联网出现之前就 被学术界广泛研究过的,那就是所谓的相关性定律这个领域那时叫情报检索,或信息检索, 也有叫全文检索的那时的相关性都是基于词频统计的,也就是说,当用户输入检索词时,搜索引擎去找那些检 索词在文章(网页)中出现频率较高的,位置较重要的,再加上一些对检索词本身常用程度 的加权,最后排出一个结果来(检索结果页面) 早期的搜索引擎结果排序都是基于本文的 第一定律的,如Infoseek, Excite, Lycos等,它们基本上是沿用了网络时代之前学术界的研 究成果,工业界的主要精力放在处理大访问量和大数据量上,对相关性排序没有突破词频统计其实根本没有利用任何跟网络有关的特性,是前网络时代的技术然而,网络时代 的主要文献是以网页的形式存在的,而几乎每个人都可以随心所欲地在网上发表各种内容, 词频相同的两个网页,质量相差可以很远,可是按照搜索引擎的第一定律,对这两个网页的 排序应该是一样的为了能够派在某些检索结果的前几位,许多网页内容的制作者绞尽脑汁, 在其页面上堆砌关键词,搜索引擎对此防不胜防,苦不堪言这种情况到了 1996 年开始有 了改变第二定律 人气质量定律1996 年 4 月,我到赌城拉斯维加斯开一个有关信息检索方面的学术会议,会议的内容就象 拉斯维加斯的天气一样,照例比较枯燥乏味。
但远离公司的我,却难得有一个静下心来认真 思考问题的机会就在听一个毫不相干的论文演讲的时候,我突然把科学引文索引的机制跟 Web 上的超级链接联系起来了 - 感谢北大,她在我上大三的时候就教授了我科学引文索引 的机制,美国恐怕没有一所大学会在你本科的时候教这玩艺儿科学引文索引的机制,说白了就是谁的论文被引用次数多,谁就被认为是权威,论文就是好 论文这个思路移植到网上就是谁的网页被链接次数多,那个网页就被认为是质量高,人气 旺在加上相应的链接文字分析,就可以用在搜索结果的排序上了这就引出了搜索引擎的 第二定律:人气质量定律根据这一定律,搜索结果的相关性排序,并不完全依赖于词频统 计,而是更多地依赖于超链分析我意识到这是一个突破性的东西,回去以后就很快总结了思路,于96年6 月申请了这一方 面的美国专利1999年 7月6 号,美国专利和商标局批准了专利号为5,920,859的,以我为 唯一发明人的专利大约在96 年底,斯坦福大学计算机系的两位研究生也想到了同样的解 决方法,他们后来创立了一个叫Google的搜索引擎,Google的网站上至今仍然说他们的这 项技术是 Patent-pending (专利申请中) ,不知道美国专利局是不是还会再批这样的专利。
Anyway, 超链分析的方法 98 年以后逐渐被各大搜索引擎所接受,由于链接是网络内容的一 个根本特性,这时候的搜索引擎才开始真正利用网络时代的检索技术世事难料, 2000 年起网络泡沫迅速破灭,各大搜索引擎要么遭人收购,要么推迟上市,所 有使用人气质量定律的搜索引擎公司都未能幸免那么,搜索引擎的出路到底在哪儿? 第三定律 自信心定律 人气质量定律解决的还是一个技术层面的问题,然而搜索引擎从诞生的那一天起,从来就不 是一个纯技术现像,它融合了技术,文化,市场等各个层面的因素解决搜索引擎公司的生 存和发展问题需要搜索引擎的第三定律--自信心定律1998年的时候,没有太多的人拿一家远在硅谷500英里以外,刚刚成立的,叫作GoT(现已更名为Overture)的公司当回事儿它不过是买了一个搜索引擎的技术服务,然后再 向那些网站的拥有者们拍卖他们网站在GoTo检索结果中的排名,谁付的钱多,谁的网站就 排在前面,而且付费是根据网民点击该网站的情况来计算的,仅仅在搜索结果中出现并不需 要付费这就是自信心定律的最早实践者!根据这一定律,搜索结果的相关性排序,除了词 频统计和超链分析之外,更注重的是竞价拍卖。
谁对自己的网站有信心,谁就排在前面有 信心的表现就是愿意为这个排名付钱需要声明的是,自信心定律也是我自己给这一模式起 的名字,以前的文献中并没有人这样总结过今天,在网络业一片萧条,那斯达克风声鹤唳的时候,GoTo却如日中天,市值高达13亿美 金,收入高达雅虎总收入的 35%反观门户网站,有哪一个能从它们的搜索引擎服务中赚 出总收入的三分之一呢?究其原因,就是因为GoTo最早实践了搜索引擎的自信心定律以 前的搜索引擎都是靠CPM来收费的,而CPM是从传统广告业借鉴过来的,没有考虑网络 媒体即时性,交互性,易竞价的特点,而竞价排名,点击收费则是为网站拥有者直接提供销 售线索,而不是传统意义上的广告宣传自信心定律一改过去搜索引擎靠CPM收钱的尴尬 局面,开创了真正属于互联网的收费模式各类搜索网站1、google如果你的网站是新发布的,或是访问量较低的网站在内容更新时,很有必要主动提交到Google,这样会使网站资料迅速更新倒Google搜索资料库,让用户能及时搜索到你的最新 资料登录地址: baidubaidu 基本跟 google 差不多登录地址: 。