当页面从几十个涨到几百上千个,最先出问题的通常不是策略,而是手工执行本身:手工改标题、手工提链接、手工盯收录,会在规模面前变成不可复用的劳动。判断标准很简单——同一动作重复出现、判断规则可以写成条件、结果需要跨页面比较时,就该从手工转为规则化或半自动处理;但涉及页面价值取舍、内容取舍和品牌口径的判断,仍应保留人工决策。
假设一个站点原本八十个页面,编辑每周手工检查一遍标题和描述,逐条记录哪些页面没被收录,再手动调整内链。这套做法在八十页时可行,因为一个人一周能看完。当页面扩到八百页,同一套动作需要十倍时间,而且不同人记录的口径开始不一致,问题就从“做得慢”变成“数据不可比”。
此时仍然可以执行的最小动作是:先不改页面,只抽取一批页面做对照记录,例如按栏目各取若干页,记录标题是否重复、正文是否过短、是否有来自其他页面的链接指向。这个动作不需要完整后台权限,也不需要抓取日志,只需要公开可见的页面。但要注意,这样得到的只是页面层线索,不能据此判断百度是否已经抓取、是否已经索引,更不能推出排名会如何变化。
当模板已经确定、变量只有栏目名和主题词时,逐条手写既慢又容易产生重复。更合适的做法是先定义命名规则,再用规则生成初稿,人工只审阅那些规则覆盖不到的页面,比如专题页、品牌页和转化页。判断依据是:如果两个页面的标题差异只来自一个可枚举的词,它就不该占用人工时间。
手工登记收录情况在页面少时可以当作抽查手段,规模上去后会变成重复劳动。更现实的做法是固定抽样比例,按栏目和页面类型分层观察,把精力放在“哪一类页面整体表现异常”上,而不是逐页确认。需要提醒的是,抽样里某些页面未被收录,可能是页面本身的问题,也可能是新页面尚未被抓取、链接路径太深、内容与已有页面高度相似,这些原因需要分开看,不能因为一次抽样就断定整站处理有误。
手工加内链在早期能保证相关性,但规模扩大后会出现两个后果:一是同一批页面被反复链接,二是新页面长期没有入口。可以改为先定义链接规则,例如同栏目优先、正文相关段落优先,再由规则生成候选,人工只处理例外。动作完成后要看的是入口分布是否更均匀,而不是某个页面是否立刻变化;入口变化只是可观察的中间结果,不能直接等同于抓取或排名结果。
页面是否值得保留、两个相似页面该合并还是分开、品牌口径怎么写,这些判断依赖业务理解,规则只能提供候选。假设一个站点有大量由同一模板生成的城市页,规则可以找出内容重复度高的页面,但“合并、改写还是保留”需要人根据实际服务范围决定。把这类判断也交给规则,常见结果是页面数量下降但有效页面没有增加。
另一个不适合完全自动化的是异常归因。某个栏目流量下降,可能来自内容更新节奏、竞争对手变化、页面改版,也可能只是统计口径调整。缺少完整数据时,能做的只是记录变化发生的时间点和同时发生的改动,不能把时间上的重合当成原因。
这条路径的边界在于:它只能说明页面层特征是否改善,不能证明抓取、索引或排名已经按预期变化。如果后续拿到了抓取或展现数据,再用来验证前面的判断,而不是用前面的抽样结果替代验证。
可以用一个简单比较:把同一动作再做一遍所需的时间,与把它写成规则并验证一次所需的时间放在一起看。假设某动作每次要花两小时、每月做四次,而写规则加验证需要一天,那么在一个月内就能回本;如果这个动作一年只做两次,手工反而更省。这个比较只是决策方法,不构成对任何具体站点的时间承诺。
真正需要警惕的不是手工本身,而是手工带来的口径漂移:不同时间、不同人记录的标准不一致,后续所有比较都会失去意义。规模扩大后,优先把“记录口径”固定下来,再决定哪些动作交给规则、哪些保留人工,这比一次性把所有工作自动化更稳妥。