采集有补跑 流水线 成功 · 08-31 21:08 · 回归验证 期次 20260831 采满 20/20 笔记 4,000 请求 213 下次运行 2026-09-07 09:00
弘摩科技 · 小红书搜索阵地监测 · 第 1 期 / 每周一次

新生儿奶粉搜索格局

当一位新手妈妈在小红书搜「新生儿奶粉怎么选」,前 200 篇笔记里说的是谁家的奶粉。 这套监测每周一次抓一次 20 个关键词的前 200 名, 看的不是某一周的水平值,而是格局怎么变。本页由采集流水线自动生成。

全页统一:红色代表飞鹤 蓝色为其他品牌

本期指标

品类词样本 3,000 条
已剔除竞品品牌词
飞鹤在品类词的声量份额
3.7% 首期 · 无环比

同批词里 a2 占 14.6%。这是本监测的第一号指标,每期看它往哪走。

前 200 名完全不提任何品牌
67.7% 首期 · 无环比

3,000 条品类词笔记里有 2,031 条是纯育儿内容,这部分是尚未被占据的货架。

视频笔记中位点赞 / 图文
5.6× 首期 · 无环比

视频中位点赞 197、图文 35,但视频只占供给的 9.4%。

监测中的空白词
3 首期 · 无环比

无品牌占比 ≥95% 的词。被别的品牌占走会在「本期变化」告警。

本期变化

四条规则每期自动比对
命中即在此列出

监测系统真正交付的是这一块:不需要人去翻表找不同, 四条规则每期跑完自动比对上期,命中就列在下面。首期没有上期可比,位置先留着。

声量第一易主

规则:某关键词的 TOP1 品牌与上期不同
首期无上期数据 · 第 2 期起自动产出

飞鹤篇数变化

规则:某关键词下 飞鹤 篇数较上期增减
首期无上期数据 · 第 2 期起自动产出

空白词被占

规则:无品牌占比从 ≥95% 跌破 95%
首期无上期数据 · 第 2 期起自动产出

新进前 20 名

规则:本期进入某词前 20 名、上期不在榜的笔记
首期无上期数据 · 第 2 期起自动产出

品类词声量份额

笔记正文 + 标签提及
右列为环比
a2
439 · 14.6%
爱他美
284 · 9.5%
飞鹤
110 · 3.7%
美素佳儿
86 · 2.9%
美赞臣
58 · 1.9%
合生元
34 · 1.1%
惠氏启赋
28 · 0.9%
金领冠
28 · 0.9%
雀巢
22 · 0.7%
雅培
11 · 0.4%
君乐宝
8 · 0.3%
森永
4 · 0.1%
佳贝艾特
3 · 0.1%
0146293439 篇

只看每个词的前 20 名(300 条, 用户真正会翻到的部分):飞鹤 4.3%、 a2 10.7%。

逐词格局

20 个关键词 × 前 200 名

每期比对的就是这张表的格子。「环比」列是本期与上期的 飞鹤 篇数差; 「空白词」标签表示该词前 200 名的无品牌占比 ≥95%,被品牌进入时会在本期变化里告警。

关键词类型声量第一飞鹤篇数环比无品牌占比视频占比中位点赞
一段奶粉推荐品类a2 · 501846%8%15
二段奶粉推荐哪个品类a2 · 66349.5%10.5%9
奶粉口碑最好的前十名品类a2 · 36655%6%38
奶粉新生儿怎么选品类a2 · 42958%9%41
好消化吸收的奶粉品类爱他美 · 381546%5%29
新生儿奶粉品类a2 · 60062.5%8%62
新生儿奶粉怎么选品类a2 · 341066.5%17%62
新生儿奶粉推荐品类a2 · 591341.5%10%53
新生儿奶粉推荐排名品类a2 · 461656.5%10.5%71
新生儿奶量标准空白词美赞臣 · 3098.5%10%523
新生儿用品清单空白词无品牌0100%12.5%476
混合喂养怎么喂才是合理的品类爱他美 · 9391%7.5%142
纯奶粉喂养品类爱他美 · 38572.5%8.5%18
肠胀气怎么缓解新生儿空白词飞鹤 · 1199.5%29%350
转奶的正确方法品类爱他美 · 181172.5%9.5%137
a2至初竞品词a2 · 143028%2%52
合生元派星怎样竞品词合生元 · 18476%9.5%6
爱他美竞品词爱他美 · 170114%7.5%8
爱他美卓傲竞品词爱他美 · 164316%3.5%6
金领冠珍护竞品词金领冠 · 18556.5%4%15

空白词

无品牌占比 ≥95%
持续监测中

这些词的前 200 名里几乎没有任何品牌内容,中位点赞却远高于品牌密集词。 妈妈们在这里问的是真问题,没有人借机说自己的奶粉——这是现成的内容切口,也是最需要盯住有没有被别人先占的地方

新生儿奶量标准
98.5%
197 / 200 条无品牌提及
中位点赞 523 · 视频占 10%
新生儿用品清单
100%
200 / 200 条无品牌提及
中位点赞 476 · 视频占 12.5%
肠胀气怎么缓解新生儿
99.5%
199 / 200 条无品牌提及
中位点赞 350 · 视频占 29%

被讨论,还是被推荐

模型标注覆盖 100%
份额与排名仍由代码算

关键词匹配只能数出「提到了谁」,数不出「推荐了谁」。 一条「A2至初 vs 爱他美 选哪个」的求助帖,规则会给两个品牌各记一笔声量, 但它其实谁也没推荐——这类无主推内容占了已标注品类词笔记的 54.6%

品牌规则提及 模型判主推主推率 正面中性 负面
a243954994.8%4795614
爱他美28427688.4%2084127
飞鹤1109180.9%75133
美素佳儿864848.8%21216
美赞臣583353.4%20112
惠氏启赋282482.1%13101
金领冠282457.1%1491
合生元341029.4%541
雀巢22836.4%422
雅培11763.6%421

主推率= 规则提及该品牌的笔记里,模型判定确实在推它的比例,分子分母同一批笔记。 越低说明这个品牌越多是被拿来比价、而不是被种草。
另有 275 条主推的是品牌清单外的牌子;模型判为主推但关键词匹配没认出的有 184 条,这是品牌词表该补的信号,不是数据错误。

内容供给结构

全样本 4,000 条

视频供给断层

视频只占供给的 9.4%,中位互动却是图文的 5.6 倍。拍视频的人少,拿到的曝光反而多。

35
197
图文 · 90.6%
视频 · 9.4%

达人极度分散

4,000 条笔记来自 3,181 位作者,其中 83.7% 只出现过一次。这是 KOC 铺量的战场。

崽崽成长碎片 · 主推飞鹤9 篇 / 5 词
言午_Xu8 篇 / 7 词
歆歆子🍥 · 主推爱他美8 篇 / 7 词
雪宝儿7 篇 / 7 词
芳云澳洲优选7 篇 / 7 词

换血速度

前 200 名里 47.2% 是近三个月发的,最老一条可追到 2017-07-10。榜单换得快,正是要按周跑的原因。

2025-082026-08

运行记录

本期实际执行情况
状态 有补跑

采集不是黑箱。每个关键词采到多少、翻了几页、有没有失败重采,都留在期次清单里, 数量对不上时先看这张表。本期 20/20 个关键词采满 200 条,共 213 次请求,耗时 8分01秒。

关键词采集请求页数本期状态补跑记录
a2至初20010正常
一段奶粉推荐20011正常
二段奶粉推荐哪个20011正常
合生元派星怎样20010正常
奶粉口碑最好的前十名20011正常
奶粉新生儿怎么选20014补跑后采满第 4 页上游 400,已重采
好消化吸收的奶粉20011正常
新生儿奶粉20011补跑后采满第 1 页上游 400,已重采
新生儿奶粉怎么选20010正常
新生儿奶粉推荐20010正常
新生儿奶粉推荐排名20011正常
新生儿奶量标准20010正常
新生儿用品清单20010正常
混合喂养怎么喂才是合理的20010正常
爱他美20010正常
爱他美卓傲20010正常
纯奶粉喂养20010正常
肠胀气怎么缓解新生儿20010正常
转奶的正确方法20010正常
金领冠珍护20011正常

流水线运行历史

开始时间触发结果 采集采集请求 新标注token 耗时
2026-08-31 21:08回归验证成功4,000002秒
2026-08-31 21:06手动测试成功4,000002秒

每步都幂等:采集跳过已采满的关键词、 入库同期覆盖、标注只跑没标过的笔记。所以重复触发不会重复计费——上面「采集请求 0」那几行就是这么来的。

调度

每周一次自动执行

  • 下次运行:2026-09-07 09:00
  • 一条命令跑完:采集 → 入库 → 标注新笔记,每步结果记进运行历史
  • 失败页自动重采;标注失败不影响数据可用
python main.py weekly --trigger 定时任务
产出

每期一套,按日期归档

  • 结构化数据 xlsx / csv(20 词 × 前 200 名)
  • 期次清单 _manifest.json(运行状态来源)
  • 本页看板,由流水线重新生成
python main.py report --period output/raw/req1_20260831
环比

第 2 期起生效

  • 指标块的环比位、声量榜的环比列、逐词表的环比列同时点亮
  • 「本期变化」四条规则开始输出命中项
  • --prev 指定上一期目录即可
python main.py report --period 本期 --prev 上期

口径与边界

给需求方对齐用

怎么算出来的

  • 声量份额:在标题、正文、标签里匹配品牌名与系列名(飞鹤 = 飞鹤/星飞帆/臻稚/卓睿/茁然)。一条笔记提到多个品牌各计一次,故各家占比之和不等于 100%。
  • 已排除干扰:「A2 蛋白」是成分不是品牌,本期识别并剔除 16 条,否则 a2 会被虚高。
  • 中位点赞用中位数不用均值,避免爆款拉偏。
  • 主推品牌与情感由模型逐条判定(覆盖 100%),结果按笔记 id 缓存, 同一条笔记跨关键词、跨周重复上榜只判一次。份额、排名、环比这些数字全部由代码算出,不经过模型。
  • 品类词样本 3,000 条 = 全量 4,000 条剔除竞品品牌词。

这版还没有的

  • 29 个字段本期填了 20 个。笔记地区 标签列表 作者性别/签名/地区/标签/认证/星座 笔记短链 需逐条调详情接口,按「先看初筛结果再决定是否补全」的安排暂未采。
  • 本期是第 1 期,环比要到第 2 期才有。趋势结论需跑满 3–4 期。
  • 最近一个月的笔记数偏高:搜索结果本身偏爱新内容,不代表当月发文量真的暴涨。

下一阶段

需求2 已确认纳入
启动前有一处口径待定
已完成

需求1 · 关键词搜索

  • 20 词 × 前 200 名,4,000 条,同词内已去重
  • 链路已跑通,每周一次可重复执行,产出按期归档
  • 看板由流水线生成,下一期跑完自动刷新
下一阶段

需求2 · 重合率测试

  • 已确认纳入,排在需求1 之后单次执行
  • 5 词 × 前 200 名 × 3 组,两两对比笔记 ID 交集数、重合率、排名偏移
  • 计算与出表逻辑已就绪,口径确认后即可启动
启动前待确认

「不同账号」怎么定义

  • 本期数据走第三方接口,账号池在服务商侧,无法指定或区分具体账号
  • 按原口径(3 个真实账号)需改走真机 / 自有账号方案,成本与周期另计
  • 接受替代口径(同词多轮独立采集)则现有链路即可执行,但验证的是结果稳定性而非账号个性化
为什么这个口径值得先定。 小红书搜索是千人千面的,同一个词不同账号看到的结果未必一致。需求2 要验证的正是 「本期这 4,000 条能在多大程度上代表客观格局」——它的结论会反过来决定 需求1 的数据该怎么解读、要不要扩大采集面。口径定义不同,得到的不是精度差异,而是两个不同的问题。
切换期次20260831 首期,无环比基准笔记查询 →