先给一个有条件的结论:当额度只够覆盖一小部分对象时,优先选“预期分歧最大、且结果能直接改变下一步动作”的样本,而不是随机抽样或按名单顺序截取。如果团队对同一事实的理解已经高度一致,或者这批查询无论结果如何都不会改变任何决策,那么挑样本的方法再讲究也没有价值,此时更合理的做法是把额度留到真正存在分歧的环节。
额度有限时最容易犯的错,是把“大家说法不一样”直接当成需要查询的问题。有时候分歧只是口径不同:一个人说的是近三十天的表现,另一个人说的是累计表现;一个人看的是自然流量,另一个人把付费渠道也算进去了。这种情况下,查询再多对象也解决不了问题,因为双方根本没在比同一个东西。
可操作的做法是先把分歧写成一句可以被结果证伪的话。比如“A类对象的转化明显低于B类”比“A类效果不好”更有信息量,因为前者一旦拿到数据就能判断成立或不成立。写不出这种句子,说明还需要先对齐定义,而不是先花额度。
同样一次查询,有的结果只会让人点头,有的结果会让人改方案。后者才值得占用额度。可以用一个简单判断:假设查询结果和预期相反,下一步会不会不一样?如果答案是不会,这个样本的信息量就偏低。
按这个标准筛一遍,通常会砍掉相当一部分候选对象。剩下的才是真正需要优先查询的。
如果多个角色对同一事实有不同理解,样本要覆盖的是分歧所在的那几个类别,而不是把名单平均切分。假设团队里有人认为新对象表现更好,有人认为老对象更稳,那么样本里就必须同时包含这两类,并且每类都要有足够数量,否则单看一个对象的结果无法区分“类别差异”和“个体偶然”。
这里要说明一个会使上述结论失效的反例:如果所有候选对象其实属于同一类别,只是命名或录入方式不同,那么按“覆盖分歧点”去挑样本就会挑出看似不同、实则重复的对象,得出的差异只是噪声。判断方法是在查询前先核对对象的定义和来源,确认它们确实属于不同类别,再决定是否按类别分配额度。
假设有二十个投放对象,额度只够查五个。团队分歧在于“高预算对象是否比低预算对象表现更好”。按覆盖分歧点的思路,可以各选两个高预算和两个低预算对象,再留一个额度给此前结果最不确定的对象。查询后如果两类差异明显,下一步就是按预算分层调整;如果差异不明显,下一步就转向检查其他变量,比如素材或投放时段,而不是继续在预算上找原因。
这个例子的前提是对象确实能按预算清晰分组,且预算之外的其他条件大致可比。如果其他条件差异很大,那么预算分组的结论就不可靠,需要先控制变量再谈下一步。
具体动作可以分三步:第一,把每个分歧写成一句可证伪的陈述;第二,为每句陈述列出能支持或推翻它的最小对象集合;第三,按“结果能否改变动作”排序,从高到低使用额度。执行后,把每个结果对应到最初那句陈述,记录它是被支持还是被推翻,以及下一步动作是否因此改变。这样一轮下来,额度花在哪里、换来了什么判断,都是可以核对的,而不是只留下一堆数字。