佛山E网工作室
www.gdasp.com
专业网站建设和推广 信心保证
热线电话:0757-6331 5297,158 1783 3537
琛屼笟璧勮 - 浣涘北E缃

琛屼笟璧勮

浜嗚В鏈鏂扮殑琛屼笟璧勮鍜岀綉缁滆惀閿鐭ヨ瘑

鏂伴椈鍒楄〃

绗 1 椤碉紝鍏 46 椤

鍒嗙被 鏍囬 鍙戝竷鏃ユ湡
SEO浼樺寲 骞翠腑浼樻儬锛屾満涓嶅彲澶憋細鏍囧噯鍨嬪椁(浜у搧灞曠ず鍨) 1800鍏冿紝0鍏冨欢闀夸竴骞寸綉绔 2012-12-28
缃戠珯寤鸿 鎵嬫満缃戦〉璁捐鎸囧崡 2012-12-28
缃戠粶鎺ㄥ箍 浣涘北姘哥綉锛圗缃戝伐浣滃锛2013骞存槬鑺備紤鍋囬氱煡 2012-12-28
鍩熷悕绌洪棿 鐧惧害鏀舵定4.83% 鑲′环鍐嶄笂100缇庡厓 杩戞湡娉㈠姩杈冨ぇ 2012-12-28
寤虹珯妗堜緥 Facebook闄峰叆鎶勮椋庢尝 绀句氦娓告垙鎴愭妱琚噸鐏惧尯 2012-12-28
SEO浼樺寲 浜笢鍟嗗煄闄峰叆璋冩暣婕╂丁 CMO钃濈儴鎺ョ寮鏀惧钩鍙 2012-12-28
缃戠珯寤鸿 鍞搧浼氬懆鍥涜穼5.32% 鎶ユ敹16.9缇庡厓 2012-12-28
缃戠粶鎺ㄥ箍 缇庡浗鐢靛晢娑堣垂鑰呮弧鎰忓害璋冩煡缁撴灉鍑虹倝锛氫簹椹婄涓 2012-12-28
鍩熷悕绌洪棿 骞村簳鐢靛晢涔辫薄锛氶樋閲2015骞翠笂甯 浜笢闄风鑱屾疆 2012-12-28
寤虹珯妗堜緥 浼犫滃紑蹇冨啘鍦衡濆紑鍙戝洟闃熲滀簲鍒嗛挓鈥濇槑骞1鏈堝叧闂 2012-12-28
SEO浼樺寲 鏉ㄥ厓搴嗗噺鎸2900涓囪仈鎯抽泦鍥㈣偂浠 濂楃幇2浜挎腐甯 2012-12-28
缃戠珯寤鸿 寮犺繎涓滃洖搴旇嫃瀹佹棤鐢靛晢鍩哄洜锛氫笉鏄細鍙戝嚑鏉″井鍗氬氨鏈 2012-12-28
缃戠粶鎺ㄥ箍 鏂版氮璋冩暣鏋舵瀯鍒掑垎闂ㄦ埛鍙婂井鍗氫袱澶т笟鍔 鏉滅孩璐熻矗闂ㄦ埛 2013-02-06
鍩熷悕绌洪棿 鏇瑰浗浼熼偖浠舵洕鍏夋柊娴2013骞存牳蹇冩垬鐣ワ細绉诲姩涓哄厛 2013-06-20
寤虹珯妗堜緥 浜哄ぇ甯稿浼氫粖鏃ヨ〃鍐冲姞寮虹綉缁滀俊鎭繚鎶ょ殑鍐冲畾 2013-07-16
SEO浼樺寲 鍒嗘瀽绉版柊娴井鍗氭垨灏嗚笍涓婂皝闂箣璺 2012-07-25
缃戠珯寤鸿 浼犻樋閲屽反宸存垬鐣ユ姇璧勬柊娴井鍗 鍗犺偂15%-20% 2012-07-25
缃戠粶鎺ㄥ箍 鐧惧害甯傚奸娆¤秴瓒婅吘璁 浠呮浜庤胺姝屼簹椹 2012-07-25
鍩熷悕绌洪棿 CNNIC锛氫腑鍥界綉姘戣妯¤揪4.85浜 绋冲眳涓栫晫绗竴 2012-10-21
寤虹珯妗堜緥 璋锋瓕鍦板浘鍗囩骇鏂板2500涓囧骇寤虹瓚鐗 瀹樻柟绉版洿缁嗚嚧 2012-10-21
SEO浼樺寲 璋锋瓕涓嶄細鍚戠敤鎴烽忛湶鐨10浠朵簨 2012-10-21
缃戠珯寤鸿 璋锋瓕椋庢姇绗笁瀛e害瀹屾垚21椤规姇璧 2012-10-21
缃戠粶鎺ㄥ箍 澶╃尗鑱斿悎48瀹剁數鍟嗚繋鎴樷11.11鈥 澶囪揣20浜 2012-10-21
鍩熷悕绌洪棿 涓氱晫鍛煎悂瑙嗛缃戠珯鎺掕缁熶竴鏍囧噯 2012-10-21
寤虹珯妗堜緥 缃戠粶鍏徃鍦ㄥ姙鍏湴鐐瑰吇缇 鐢ㄧ儰鍏ㄧ緤瀹磋瀹㈡埛 2012-10-21
SEO浼樺寲 涓叴閫氳20浜垮厓宸ㄤ簭 缇庡浗瀹夊叏璋冩煡缁撴潫鎬濈鍚堜綔 2012-10-21
缃戠珯寤鸿 鐧惧害鎴愮珛LBS浜嬩笟閮 鎷ユ湁鍦板浘灏辨嫢鏈夌敤鎴 2012-10-21
缃戠粶鎺ㄥ箍 鏈濋矞涓囧悕绉戞妧浜烘墠鍏ュ崕锛氭湀宸ヨ祫1500鍏 60%涓婄即缁勭粐 2012-10-21
鍩熷悕绌洪棿 Twitter闃愯堪鏈潵鍙戝睍鏂瑰悜锛氬寮烘湇鍔″疄鐢ㄦ 2012-12-28
寤虹珯妗堜緥 璋锋瓕6鏈堣潐鑱斿叏缇庤闂噺绗竴瀹濆骇 2012-12-28
      最新资讯
年中优惠,机不可失:标
手机网页设计指南
佛山永网(E网工作室)
百度收涨4.83% 股
Facebook陷入抄
京东商城陷入调整漩涡
唯品会周四跌5.32%
美国电商消费者满意度调
年底电商乱象:阿里20
传“开心农场”开发团队
杨元庆减持2900万联
张近东回应苏宁无电商基
新浪调整架构划分门户及
曹国伟邮件曝光新浪20
人大常委会今日表决加强
分析称新浪微博或将踏上
传阿里巴巴战略投资新浪
百度市值首次超越腾讯
CNNIC:中国网民规
谷歌地图升级新增250
         行业资讯 >> 一场国际搜索引擎公关大战即将上演
一场国际搜索引擎公关大战即将上演
发布人:管理员  发布时间:2008年5月20日  浏览 3329 次
分享 |


    互联网在近10年的得到飞速发展,互联网正在逐渐深入人们的生活,改变人们的生活。互联网经济也经历了风风雨雨,从缓慢起步到急速膨胀,从泡沫破灭到逐步回 暖;从“网络广告”到“拇指经济”,从“网络游戏”到“搜索力经济”。目前,搜索引擎成为最受人们关注的焦点之一,也成为亿万富翁的制造摇篮。越来越多的 公司都希望在搜索引擎这座金矿中挖到筐金子,其中许多人会选择拥有自己的搜索引擎。国内著名搜索引擎公司百度(http://www.baidu.com)总裁李彦宏说:搜索引擎不是人人都能做的领域,进入的门槛比较高。

    搜索引擎的门槛到底有多高?搜索引擎的门槛主要是技术门槛,包括网页数据的快速采集、海量数据的索引和存储、搜索结果的相关性排序、搜索效率的毫秒级要 求、分布式处理和负载均衡、自然语言的理解技术等等,这些都是搜索引擎的门槛。对于一个复杂的系统来说,各方面的技术固然重要,但整个系统的架构设计也同 样不可忽视,搜索引擎也不例外。

    搜索引擎技术和分类

    搜索引擎的技术基础是全文检索技术,从20世纪60年代,国外对全文检索技术就开始有研究。全文检索通常指文本全文检索,包括信息的存储、组织、表现、查 询、存取等各个方面,其核心为文本信息的索引和检索,一般用于企事业单位。随着互联网信息的发展,搜索引擎在全文检索技术上逐渐发展起来,并得到广泛的应 用,但搜索引擎还是不同于全文检索。搜索引擎和常规意义上的全文检索主要区别有以下几点:

    数据量 传统全文检索系统面向的是企业本身的数据或者和企业相关的数据,一般索引库规模多在GB级,数据量大的也只有几百万条;但互联网网页搜索需要处理几十亿的网页,搜索引擎的策略都是采用服务器群集和分布式计算技术。

    内容相关性 , 信息太多,查准和排序就特别重要,Google等搜索引擎采用网页链接分析技术,根据互联网上网页被链接次数作为重要性评判的依据;但全文检索的数据源中相互链接的程度并不高,不能作为判别重要性的依据,只能基于内容的相关性排序。

    安全性. 互联网搜索引擎的数据来源都是互联网上公开的信息,而且除了文本正文以外,其它信息都不太重要;但企业全文检索的数据源都是企业内部的信息,有等级、权限 等限制,对查询方式也有更严格的要求,因此其数据一般会安全和集中地存放在数据仓库中以保证数据安全和管理的要求。

    个性化和智能化. 搜索引擎面向的是互联网访问者,由于其数据量和客户数量的限制,自然语言处理技术、知识检索、知识挖掘等计算密集的智能计算技术很难应用,这也是目前搜索引擎技术努力的方向;而全文检索数据量小,检索需求明确,客户量少,在智能化和个性可走得更远。

    搜索引擎与全文检索除了以上的区别外,还结合互联网信息的特点形成了三个不同的类型:

    全文检索搜索引擎 :全文搜索引擎是名副其实的搜索引擎,国外具代表性的有Google (http://www.google.com) 、yahoo(http://search.yahoo.com) 、AllTheWeb (http://www.alltheweb.com ) 等,国内著名的有百度(http://www.Baidu.com)、中搜(http://www.zhongsou.com)。它们都是通过从互联网上提取的各个网站的信息(以网页文字为主)而建立的数据库,检索与用户查询条件匹配的相关记录,然后按一定的排列顺序将结果返回给用户,也是目前常规意义上的搜索引擎。

    目录搜索引擎 :目录索引虽然有搜索功能,但在严格意义上算不上是真正的搜索引擎,仅仅是按目录分类的网站链接列表而已。用户完全可以不用进行关键词查询,仅靠分类目录也可找到需要的信息。国外比较著名的目录索引搜索引擎有yahoo(http://www.yahoo.com)Open Directory Project(DMOZ)(http://www.dmoz.com/)、LookSmart(http://www.looksmart.com)等。国内的搜狐(http://www.sohu.com)、新浪(http://www.sina.com)、网易(http://www.163.com)搜索也都具有这一类功能。
   
    元搜索引擎 :元搜索引擎在接受用户查询请求时,同时在其它多个引擎上进行搜索,并将结果返回给用户。著名的元搜索引擎有Dogpile(http://www.dogpile.com)、Vivisimo(http://www.vivisimo.com)等,国内元搜索引擎中具代表性的有搜星搜索引擎(http://www.soseen.com/),优客搜索(http://www.yok.com)。在搜索结果排列方面,有的直接按来源引擎排列搜索结果,如Dogpile,有的则按自定的规则将结果重新排列组合,如Vivisimo。

    其他的像新浪(http://search.sina.com.cn) 、网易(http://search.163.com)、 A9(http://www.A9.com) 等搜索引擎都是调用其它全文检索搜索引擎,或者在其搜索结果的基础上做了二次开发。
 
    搜索引擎的系统架构

    这里主要针对全文检索搜索引擎的系统架构进行说明,下文中提到的搜索引擎如果没有特殊说明也是指全文检索搜索引擎。搜索引擎的实现原理,可以看作四步:从互联网上抓取网页→建立索引数据库→在索引数据库中搜索→对搜索结果进行处理和排序。

    从互联网上抓取网页. 利用能够从互联网上自动收集网页的网络蜘蛛程序,自动访问互联网,并沿着任何网页中的所有URL爬到其它网页,重复这过程,并把爬过的所有网页收集到服务器中。

    建立索引数据库 . 由索引系统程序对收集回来的网页进行分析,提取相关网页信息(包括网页所在URL、编码类型、页面内容包含的关键词、关键词位置、生成时间、大小、与其它 网页的链接关系等),根据一定的相关度算法进行大量复杂计算,得到每一个网页针对页面内容中及超链中每一个关键词的相关度(或重要性),然后用这些相关信 息建立网页索引数据库。

    在索引数据库中搜索 . 当用户输入关键词搜索后,分解搜索请求,由搜索系统程序从网页索引数据库中找到符合该关键词的所有相关网页。

    对搜索结果进行处理排序 . 所有相关网页针对该关键词的相关信息在索引库中都有记录,只需综合相关信息和网页级别形成相关度数值,然后进行排序,相关度越高,排名越靠前。最后由页面生成系统将搜索结果的链接地址和页面内容摘要等内容组织起来返回给用户。 下图是一个典型的搜索引擎系统架构图,搜索引擎的各部分都会相互交错相互依赖。其处理流程按照如下描述:
 
    “网络蜘蛛”从互联网上抓取网页,把网页送入“网页数据库”,从网页中“提取URL”,把URL送入“URL数据库”,“蜘蛛控制”得到网页的URL,控制“网络蜘蛛”抓取其它网页,反复循环直到把所有的网页抓取完成。 系统从“网页数据库”中得到文本信息,送入“文本索引”模块建立索引,形成“索引数据库”。同时进行“链接信息提取”,把链接信息(包括锚文本、链接本身等信息)送入“链接数据库”,为“网页评级”提供依据。 “用户”通过提交查询请求给“查询服务器”,服务器在“索引数据库”中进行相关网页的查找,同时“网页评级”把查询请求和链接信息结合起来对搜索结果进行相关度的评价,通过“查询服务器”按照相关度进行排序,并提取关键词的内容摘要,组织最后的页面返回给“用户”。
 
    搜索引擎的索引和搜索

    对于网络蜘蛛技术和排序技术请参考作者其它文章,这里以Google搜索引擎为例主要介绍搜索引擎的数据索引和搜索过程。

    数据的索引分为三个步骤:网页内容的提取、词的识别、标引库的建立。

    互联网上大部分信息都是以HTML格式存在,对于索引来说,只处理文本信息。因此需要把网页中文本内容提取出来,过滤掉一些脚本标示符和一些无用的广告信 息,同时记录文本的版面格式信息[1]。词的识别是搜索引擎中非常关键的一部分,通过字典文件对网页内的词进行识别。对于西文信息来说,需要识别词的不同 形式,例如:单复数、过去式、组合词、词根等,对于一些亚洲语言(中文、日文、韩文等)需要进行分词处理[3]。识别出网页中的每个词,并分配唯一的wordID号,用于为数据索引中的标引模块服务。

    标引库的建立是数据索引中结构最复杂的一部分。一般需要建立两种标引:文档标引和关键词标引。 文档标引分配每个网页一个唯一的docID号,根据docID标引出在这个网页中出现过多少过wordID,每个wordID出现的次数、位置、大小写格 式等,形成docID对应wordID的数据列表;关键词标引其实是对文档标引的逆标引,根据wordID标引出这个词出现在那些网页(用wordID表 示),出现在每个网页的次数、位置、大小写格式等,形成wordID对应docID的列表。

    关于索引数据的详细数据结构,有兴趣的朋友可以参看文献。

    搜索的处理过程是对用户的搜索请求进行满足的过程,通过用户输入搜索关键字,搜索服务器对应关键词字典,把搜索关键词转化为wordID,然后在标引库中 得到docID列表,对docID列表进行扫描和wordID的匹配,提取满足条件的网页,然后计算网页和关键词的相关度,根据相关度的数值返回前K篇结 果(不同的搜索引擎每页的搜索结果数不同)返回给用户。如果用户查看的第二页或者第多少页,重新进行搜索,把排序结果中在第K+1到2*K的网页组织返回 给用户。其处理流程如下图所示:

    搜索引擎细化趋势

    随着搜索引擎市场空间越来越大,搜索引擎也分得越来越细。互联网没有国界,百度总裁李彦宏所讲:搜索引擎市场是赢家通吃的市场。如果一个搜索引擎要想在搜 索市场上有自己的一席之地,必须拥有自己的特色。而且,数以亿计的网民,搜索需求不可能都一样,不同类型的用户需要不同类型的搜索引擎,网页搜索只是搜索 需求中的一种,这就决定了搜索引擎会不断细化,各具特色的搜索引擎也陆续出现。

    从技术上讲,各种搜索引擎都具有类似的系统架构,其不同在于搜索的数据源的不同。除了上面提到的网页搜索引擎以外,下面列举几个典型的搜索引擎:

    新闻搜索引擎 . 看新闻是许多网民上网的主要目的,新闻搜索也就成了查看新闻的重要工具。新闻搜索引擎实现的过程比较简单,一般是扫描国内外有名的新闻网站,抓取新闻网 页,建立自己的新闻数据库,然后提供搜索,只是对新闻网页抓取的频率要求很高,有的需要做到几分钟扫描一次。现在许多大型的网页搜索引擎都提供相应的新闻 搜索功能,如:Google新闻搜索(http://news.google.com),中搜新闻搜索(http://news.zhongsou.com),百度新闻搜索(http://news.baidu.com)等。

    音乐搜索引擎 . 有了互联网以后,音乐得到了广泛的传播,对于喜欢音乐的网民来说,音乐搜索引擎成了最钟爱的工具。音乐搜索引擎需要监控互联网上大型的音乐网站,抓取其音乐数据的描述信息,形成自己的数据库,音乐的下载和试听都会在其原来的音乐网站上进行。目前有:搜刮网(http://www.sougua.com),百度mp3搜索(http://mp3.baidu.com),1234567搜索(http://www.1234567.com)等。

    图像搜索引擎 . 通过图像搜索引擎可以找到自己感兴趣的图片链接,各大搜索引擎也提供了图像搜索功能。图像文件本身不能够被搜索引擎索引,但搜索引擎可以通过链接文本分析和图片注解等得到图片的信息。目前有:Google图像搜索(http://images.google.com/),VisionNext搜索(http://www.eefind.com),百度图像搜索(http://images.baidu.com)等。

    商机搜索引擎 . 电子商务一直是互联网的热点,商机搜索对电子商务的发展也起到了巨大的推动作用,商机搜索让互联网经济和传统经营紧密结合在一起,给传统的企业提供了一个 新的销售模式。商机搜索引擎,通过抓取电子商务网站的商品信息和其他商业信息,给访问者提供统一的搜索平台。目前有:soaso价格搜索引擎(http://www.soaso.com),8848购物搜索(http://www.8848.com),阿里巴巴商机搜索(http://www.alibaba.com)等。

 




    (本站大部分文章来自网络收集和整理,如有侵权请联系我们,24小时内处理.)



佛山市红盾信息网
网络110报警