没有历史流量时,可验证假设不能建立在“改完会涨”上,而应建立在你能否在改动前后观察到一条稳定的对照线索。更现实的做法是:先选一个标签页,把“分类规则是否让用户更快找到内容”写成可判定的命题,再用站内搜索词、页面点击分布或人工路径测试去验证。流量小的时候,不要指望排名数据给出结论,而要接受小样本只能排除明显错误,不能证明方向正确。
新业务的标签分类优化,起点通常分两种。第一种是已经有一点站内行为:用户会搜索某些词、会从首页点进标签页、会在标签页里继续点击。第二种是几乎没有行为,只有你自己定义的分类和一批待归类内容。两种条件下,假设的写法完全不同。
有行为线索时,假设可以围绕“用户使用的词与标签名不一致”展开。例如站内搜索里反复出现“报价”“价格”“费用”,而你的标签叫“方案说明”,那么可以假设:把该标签的展示名和简介调整为更接近用户用词,会让进入该标签页的人更容易继续点击其中的内容。这个假设的验证对象是标签页内的点击分布,而不是搜索排名。
只有页面本身时,假设要退一步,围绕“分类是否可被理解”展开。可以假设:同一批内容按主题分成三组,比按内容形式分成三组,更容易让第一次访问的人在三十秒内说出这个标签页在讲什么。验证方式可以是找几位不熟悉该业务的人做短测试,记录他们能否复述分类含义,以及会先点哪一条。这里的关键不是人数多,而是能否暴露理解障碍。
“标签分类优化能提升用户体验”无法验证。可验证的写法至少要包含对象、改动、观察点和判定条件。对象是哪一个标签页;改动是标签名称、分组方式、排序规则还是页内说明;观察点是站内搜索词、标签页点击、跳出行为或人工测试回答;判定条件是出现什么结果算支持,出现什么结果算不支持。
一个假设例子:某新业务把“行业资讯”标签下的内容按客户类型重新分组,并保持内容本身不变。假设是:重新分组后,从该标签页进入第二层内容的点击比例会高于改动前。若改动后点击比例没有变化,或者只有少数固定用户仍在点击,那么这个假设没有被支持。此时下一步不是继续微调标签颜色,而是回到用户用词和内容供给上找原因。
这里要接受一个限制:小流量下的比例波动可能来自偶然。比较稳妥的做法是同时看两类证据——一类是行为数据,一类是人工测试中的原话。两类证据方向一致时,才值得扩大到更多标签页;方向冲突时,优先检查分类规则是否真的对应了用户任务。
具体动作可以按下面顺序推进。
这个动作的结果会直接影响下一步。如果假设被支持,可以把同一分类规则复制到结构相似的标签页;如果不被支持,应优先怀疑分类依据本身,而不是怀疑流量太少。流量少确实会让数据不稳定,但它不能解释为什么人工测试里的人也找不到内容。
并非所有标签页都适合拿来验证。包含内容少于五条、长期不更新、或者主要靠广告进入的标签页,通常不适合承担第一轮假设。内容太少时,点击分布没有足够变化空间;长期不更新时,用户行为受旧内容影响;靠广告进入时,访问者意图与自然访问者不同,结论不能直接迁移。
另一个例外是品牌词或活动词标签。这类标签页的访问者往往已经知道要找什么,分类改动对行为的影响很弱。把它们放进第一轮,容易得到“改不改都一样”的结论,却误以为分类优化无效。
还要注意,抓取和索引正常并不等于分类有效。搜索引擎能理解和用户能找到是两件事。新业务没有历史流量时,标签分类优化的价值更多在于把内容组织成可被理解、可被继续点击的结构,而不是用一次改动去换取排名结果。先让一个标签页的假设成立或明确不成立,再决定是否扩大到全站分类体系。