显示标签为“复制内容”的博文。显示所有博文
显示标签为“复制内容”的博文。显示所有博文

2017年7月25日星期二

如何判断你的网站是否已被Google惩罚及处理方法

做SEO最害怕发生的一件事就是,自己为公司做优化的网站被搜索引擎惩罚。被惩罚的程度虽有重有轻(视SEO违规的层次而定),但都会对SEO造成极不良的影响。重者网站所有页面将被搜索引擎永久删除不再收录,自然排名就无从谈起了。下面我们就来详细谈谈“如何判断网站是否已被Google惩罚及被惩罚后的处理方法”。

辨别搜索引擎惩罚
网站会被惩罚,一旦发生,知道怎么处理对恢复搜索排名很有帮助。因此,我们需要了解其机制。
辨别机制:
如何确认你优化的公司网站是已被惩罚,还是仅仅排名输给了竞争对手?首先,第一步,你的网站还被谷歌索引吗?如果收录正常(可用site指令检查),再来看第二步,搜索域名(或者其他独特品牌词)时,你的网站是否还有排名?如果答案是有,接着来看第三步,搜索页面标题标签中五到六个相对独特的词时,你的网站还排在前二十名吗?如果答案是是,那么通过这几步基本检查可以断定:恭喜你,你的网站没有被惩罚,只是在排名上输给了竞争对手。你需要检查你的页面SEO,进行优化调整,以及想办法获得一些高质量、非操控的链接,来提高排名。
接下来看看当这三步是否定时的分析和处理办法。
第一步检查的答案是完全没收录或者只剩首页时,分析及处理措施:网站很可能被搜索引擎删除了。在站长工具中验证网站,再次检查,删除垃圾后,向搜索引擎提交重新收录请求。
第一步答案是是,第二步答案是否时,分析及处理措施:你可能因为意图操控链接的行为或页面上的垃圾(隐藏页面、堆砌关键字等等)而被惩罚。首先,删除所有潜在不好的导出链接,停止任何(google可能已经发现的)付费链接,解决页面问题,然后到谷歌站长工具注册、验证,提交重新收录请求,承认作弊,保证不再犯。
前两步答案是是,第三步答案是否时,分析及处理措施:很可能你的很多链接失去了它们的作用。谷歌反垃圾组有较强的鉴别和去除很多网站或网络传递链接权重的能力。到站长工具注册、验证,提交重新收录请求,说对不起,找出坏链接,请求原谅,然后去建立大量高质量、自然的链接,让公司网站重新在谷歌获得排名。
以上即为辨别网站是否被惩罚的机制流程。
有一点很重要的要记住的是,搜索引擎会不停的修改它们的算法的(谷歌每天都改动算法)。排名上下波动不一定构成惩罚。让不了解SEO的管理团队成员理解这一点尤其有挑战性。而以上所列出的详细辨别机制流程,则有助于帮他们更好的理解惩罚与排名自然波动之间的区别。

公司网站被谷歌惩罚了该怎么办?
被惩罚后的处理措施:重新收录/重新审查请求
通过上面提供的惩罚基本辨别机制,一旦确认网站被惩罚,你需要采取两个步骤来恢复网站的搜索排名。第一步是解决导致惩罚的问题。如果你参与了很多被搜索引擎认为是意图操控的活动,或是你无意中违反了搜索引擎指南,这就可能并不容易。但是除非你解决问题,不然惩罚不会消失。
问题接解决后,你可以提交重新收录/重新审查请求。不过,如果没有解决问题就提交了请求,如果你不是那么坦诚,或者如果在请求中忽略了关键事实,你可能在冒毁掉后路的风险,让惩罚更坚固。首先,你的请求可能被忽略。其次,如果你改正问题后再次提交请求的话,请求可能不被理睬,这种情况下你的网站基本上就死定了。


以下是一些SEO新手经常容易犯的违反SEO规则的常见的错误:
(1)在页面中堆砌关键字,因此这些词多得不自然,明显生凑硬拼。
(2)对内部链接进行过度优化了。一般而言,这可能表现为在内部链接的锚文字中过度堆砌关键词。
(3)通过一些技术隐藏页面,即给谷歌搜索引擎显示的内容与给用户显示的内容不一样。
(4)创建带有大量内容贫乏页面的网站。(可见,内站和外站都应提供高质量内容的页面。)
(5)隐藏文字,搜索引擎读得到而用户看不到的内容
(6)参与链接计划(例如纯粹为了留链接而在其他博客和论坛留言),参与链接农场等纯粹是为了提高链接流行度的行为。

2017年5月2日星期二

如何隐藏内容也可能成为SEO问题

一般来说,尽量让google搜索引擎抓取和索引更多内容是谷歌SEO们经常头疼的一个问题,没有收录、索引就无从谈排名。尤其对达到一定规模的网站来说,使网站充分收录是个颇令人费神的SEO技术,当页面达到比如说几十万,无论网站架构怎么设计、多么优化,100%收录都是不可能的,只能尽量提高收录率。
但有时候怎么阻止搜索引擎收录也可能成为一个问题,最近越来越成为问题。需要阻止收录的情况如保密信息、复制内容、广告链接等。过去常用的阻止收录方法包括密码保护、把内容放在表格后面、使用JS/Ajax、使用Flash等。今天看到Google网管博客一篇文章,这些方法都不保险。

使用Flash

Google几年前就开始尝试抓取Flash内容了,简单文字性内容已经能抓取。Flash里面的链接也能被跟踪。

表格

Google蜘蛛也能填表,也能抓取POST请求页面。这个早就能从日志中看到。

JS/Ajax

使用JS链接一直以来被当作不搜索引擎友好的方法,因此可以阻止蜘蛛爬行,但两三年前我就看到JS链接不能阻止Google蜘蛛抓取,不仅JS中出现的URL会被爬,简单的JS还能被执行找到更多URL。
前几天有人发现很多网站使用的Facebook评论插件里的评论被爬、被收录,插件本身是个AJAX。这是个好消息。我的一个实验电子商务网站产品评论功能就因为这个费了不少心思,用Facebook comments插件好处大大的,具体什么好处以后有时间再说,唯一的问题就是评论是AJAX实现的,不能被抓取,而产品评论被收录是目的之一(产生原创内容)。我当时想了半天也没有解决方法,只好先傻傻地既放上Facebook comments插件又打开购物车本身的评论功能。现在好了,Facebook comments里的评论能被收录,就不用两套评论功能了。

Robots文件

目前唯一确保内容不被收录的方法是robots文件禁止。但也有个坏处,会流失权重,虽然内容是不能收录了,但页面成了只接受链接权重、不流出权重的无底洞。

Nofollow

Nofollow并不能保证不被收录。就算自己网站所有指向页面的链接都加了NF,也不能保证别人网站不给这个页面弄个链接,搜索引擎还是能发现这个页面。

Meta Noindex + Follow

(11月3日补充)读者no1se提醒,为防止收录又能传递权重,可以在页面上使用meta noindex和 meta follow,这样页面不收录,但能流出权重。确实如此,也是个比较好的方法。也有一个问题,还是会浪费蜘蛛爬行时间。哪位读者有能防止收录、又没有权重流失、又不浪费爬行时间的方法,请留言,对SEO界功德无量。
怎样使页面不被收录是个值得思考的问题,没意识到严重性的童鞋可以想想自己网站上有多少复制内容、低质量内容、各种无搜索价值(但用户觉得方便、有用所以又不能拿掉)的分类、过滤URL。

2017年4月26日星期三

怎样减少无效URL的爬行和索引 – 无完美解

少年老成的云晨守望同学(题外话:少年老成是好事哈。我20多岁时人家说我像40岁,我40多岁时好多人说我像30多,男人20到50岁可以做到基本一个样子)在网络营销实战密码网站贴了个帖子:透过京东商城看国内一线B2C网站SEO通病。建议先看那个帖子再回来看本帖,不然不容易明白下面在说什么。
简单说,帖子指出一个严重而且现实的SEO问题:很多网站,尤其是B2C,产品条件过滤系统(如选择产品的品牌、价格、尺寸、性能、参数等)会产生大量无效URL,之所以称为无效只是从SEO角度看的,这些URL并不能产生SEO作用,反倒有负面作用,所以这些URL不收录为好,原因包括:
  • 大量过滤条件页面内容重复或极为类似(大量复制内容将使网站整体质量下降)
  • 大量过滤条件页面没有对应产品,页面无内容(如选择“100元以下42寸LED电视”之类的)
  • 绝大部分过滤条件页面没有排名能力(排名能力比分类页面低得多)却浪费一定权重
  • 这些过滤条件页面也不是产品页面收录的必要通道(产品页面应该有其它内链帮助爬行和收录)
  • 爬行大量过滤条件页面极大浪费蜘蛛爬行时间,造成有用页面收录机会下降(过滤条件页面组合起来是巨量的)
那么怎样尽量使这些URL不被爬行和索引、收录呢?前几天的一篇帖子如何隐藏内容也可能成为SEO问题讨论的是类似问题,这种过滤页面就是想隐藏的内容种类之一。不过可惜,我目前想不出完美的解决方法。云晨守望提出两个方法,我觉得都无法完美解决。
一是将不想收录的URL保持为动态URL,甚至故意越动态越好,以阻止被爬行和收录。但是,搜索引擎现在都能爬行、收录动态URL,而且技术上越来越不是问题。虽然参数多到一定程度确实不利于收录,但4、5个参数通常还可以收录。我们无法确认需要多少参数才能阻止收录,所以不能当作一个可靠的方法。而且这些URL接收内链,又没有什么排名能力,还是会浪费一定权重。
第二个方法,robots禁止收录。同样,URL接收了内链也就接收了权重,robots文件禁止爬行这些URL,所以接收的权重不能传递出去(搜索引擎不爬行就不知道有什么导出链接),页面成为权重只进不出的黑洞。
连向这些URL的链接配合nofollow也不完美,和robots禁止类似,nofollow在Google的效果是这些URL没有接收权重,权重却也没有被分配到其它链接上,所以权重同样浪费了。百度据称支持nofollow,但权重怎么处理未知。
将这些URL链接放在Flash、JS里也没有用,搜索引擎已经可以爬行Flash、JS里的链接,而且估计以后越来越擅长爬。很多SEO忽略了的一点是,JS中的链接不仅能被爬,也能传递权重,和正常连接一样。
也可以将过滤条件链接做成AJAX形式,用户点击后不会访问一个新的URL,还是在原来URL上,URL后面加了#,不会被当成不同URL。和JS问题一样,搜索引擎正在积极尝试爬行、抓取AJAX里的内容,这个方法也不保险。
还一个方法是在页面head部分加noindex+follow标签,意即本页面不要索引,但跟踪页面上的链接。这样可以解决复制内容问题,也解决了权重黑洞问题(权重是可以随着导出链接传到其它页面的),不能解决的是浪费蜘蛛爬行时间问题,这些页面还是要被蜘蛛爬行抓取的(然后才能看到页面html里的noindex+follow标签),对某些网站来说,过滤页面数量巨大,爬行了这些页面,蜘蛛就没足够时间爬有用页面了。
再一个可以考虑的方法是隐藏页面(cloaking),也就是用程序检测访问者,是搜索引擎蜘蛛的话返回的页面拿掉这些过滤条件链接,是用户的话才返回正常的有过滤条件的页面。这是一个比较理想的解决方法,唯一的问题是,可能被当作作弊。搜索引擎常跟SEO讲的判断是否作弊的最高原则是:如果没有搜索引擎,你会不会这么做?或者说,某种方法是否只是为了搜索引擎而采用?显然,用cloaking隐藏不想被爬行的URL是为搜索引擎做的,不是为用户做的。虽然这种情况下的cloaking目的是美好的,没有恶意的,但风险是存在的,胆大的可试用。
还一个方法是使用canonical标签,最大问题是百度是否支持未知,而且canonical标签是对搜索引擎的建议,不是指令,也就是说这个标签搜索引擎可能不遵守,等于没用。另外,canonical标签的本意是指定规范化网址,过滤条件页面是否适用有些存疑,毕竟,这些页面上的内容经常是不同的。
目前比较好的方法之一是iframe+robots禁止。将过滤部分代码放进iframe,等于调用其它文件内容,对搜索引擎来说,这部分内容不属于当前页面,也即隐藏了内容。但不属于当前页面不等于不存在,搜索引擎是可以发现iframe中的内容和链接的,还是可能爬行这些URL,所以加robots禁止爬行。iframe中的内容还是会有一些权重流失,但因为iframe里的链接不是从当前页面分流权重,而只是从调用的那个文件分流,所以权重流失是比较少的。除了排版、浏览器兼容性之类的头疼问题,iframe方法的一个潜在问题是被认为作弊的风险。现在搜索引擎一般不认为iframe是作弊,很多广告就是放在iframe中,但隐藏一堆链接和隐藏广告有些微妙的区别。回到搜索引擎判断作弊的总原则上,很难说这不是专门为搜索引擎做的。记得Matt Cutts说过,Google以后可能改变处理iframe的方式,他们还是希望在同一个页面上看到普通用户能看到的所有内容。
总之,对这个现实、严重的问题,我目前没有自己觉得完美的答案。当然,不能完美解决不是就不能活了,不同网站谷歌SEO重点不同,具体问题具体分析,采用上述方法中的一种或几种应该可以解决主要问题。
而最最最大的问题还不是上述这些,而是有时候你让这些过滤页面被爬行和收录,这才是杯具的开始。以后再讨论。