图书竞品分析
以"证据充分、结论一眼可见、未知不伪造"为原则完成调研和 Excel 交付。
开始前
- 确认书名、作者、封面和版本,防止同名书混入。
- 确认目标平台:以用户指定的平台为准;用户未指定时先询问,不要自行假设或默认某几个平台。
- 检查浏览器访问条件:本技能的所有调研必须真实打开平台页面,详见"真实访问(强制)"。
- 创建或编辑
.xlsx时使用本环境的表格处理能力(sheetagent),完整遵循其生成和视觉验证流程。 - 生成或编辑
.xlsx前,先完整读取 质量与口径 和 Excel 模板;生成后逐项自检。
真实访问(强制)
所有案例和数据必须来自平台真实数据,这是一条不可绕过的硬性要求:
- 严禁凭模型记忆、搜索结果摘要、第三方转述或想象编写案例内容、互动数据、分镜或评论。任何没有真实看到的字段一律留空或标注待核验。
- 每条记录必须能回答"这条信息是从哪个真实来源拿到的"(接口返回的原帖链接也算),并写明采集日期。
- 关键案例(头部爆款、强负评、用户点名案例)留存可追溯证据:结构化采集路线下用原帖链接+结构化数据留痕;浏览器路线下在详情页截图存档到交付目录
evidence/<平台名>/(命名账号-发布日期-序号.png),并在 Excel 证据列写明。
采集路线(按优先级)
路线 A:结构化采集工具(首选,2026-09 实战验证)。本机已部署 MediaCrawler(~/WorkBuddy/出版skills/MediaCrawler,独立 venv),优势:结构化字段零错位(标题/正文/赞藏评转/精确发布日期/原链/检索词全齐)、登录态扫码一次永久缓存、独立浏览器不占用用户日常浏览器、评论全量落盘:
cd ~/WorkBuddy/出版skills/MediaCrawler
env -u PYTHONPATH ./venv/bin/python main.py --platform xhs --lt qrcode --type search --keywords "词1,词2,词3"
--platformxhs | dy;--keywords英文逗号分隔(支持"达人名 书名"空格组合词);每词采集量在config/base_config.py的CRAWLER_MAX_NOTES_COUNT调整- 检索矩阵规模参考(2026-09 全量实战验证配置):每平台 8—10 个检索词、每词 20 条,两平台共约 220 条去重样本,足够支撑四模块结论;词量先少后多,第一轮书名词跑完,第二轮按"达人名+书名"组合词+新发现高频词补检
- 必须
env -u PYTHONPATH:宿主环境注入的 PYTHONPATH 拦截层会让 pip 装 sdist 报 EEXIST - 两平台输出目录:
data/xhs/json/与data/douyin/json/(注意第2个平台目录名是douyin不是dy);同名文件按日追加,笔记按 note_id/aweme_id 去重、评论按 comment_id 去重;换采集方案前把旧数据备份到别的文件名(两平台输出文件同名,会互相覆盖备份) - 时间戳:xhs 的
time为毫秒级时间戳,douyin 的create_time为秒级,统一换算后再按月统计 - 首次跑新平台会弹独立 Chrome 窗出二维码,请用户扫一次码(之后缓存)
- 隐私:昵称默认打码(
小***啊),交付说明要注明
路线 B:接管用户日常浏览器(截图/人工核验/补充用)。让用户打开自己平时使用的浏览器并保持平台登录态,通过调试端口(CDP)接管现有实例:
- 用户侧准备:在浏览器 inspect/调试设置页打开"允许远程调试此浏览器实例"类开关(浏览器完全重启后需重新打开);
- 用户的浏览器已在运行时,不要再启动第二个同款浏览器实例(单实例机制会冲突闪退),只能接管现有实例;
- 用途:给头部案例补证据截图、人工点开核验待核验案例(如"达人名+书名"组合词命中的文案不带书名的爆款)。
路线 C:headless / headed 弹窗(不推荐)。实战证明 headless 无登录态必被风控(IP 风控错误码/滑块验证码),headed 在部分环境弹不出窗口。命中风控不要反复重试,直接升级到路线 A/B。
通用注意事项:
- 首次请求偶发网关错误(502 等)多为瞬时现象:重试一次再判断是否真失败。
- 详情数据优先走独立 URL 或接口返回,不要依赖页面内弹窗/模态框提取——模态提取容易串到相邻内容造成数据错位;若只能用模态,必须用作者名或链接校验提取结果与目标案例一致。
- 如果所有真实访问方式都失败(用户无法配合、平台强拦截),走"降级交付"路径(见下)。
降级交付(所有真实访问方式失败时)
真实访问完全不可用时,经用户确认后,可降级为公开信息复盘模式:
- 用 WebSearch/WebFetch 收集公开可访问内容:书评网站、媒体报道、出版社官方稿、公开博客和文章。
- 每条记录必须标注核验层级为
非平台真实核验,写明信息来源 URL。 - Excel 口径从"竞品营销分析"改为"公开信息复盘":时间轴、达人名单等依赖平台数据的模块如实写"不可得",不编造。
- 交付说明中必须明确写清:本次为降级模式,平台内互动数据、铺稿节奏、达人实际表现均未核验,结论不能外推到平台真实营销情况。
调研方法
1. 建立检索词矩阵
不要只搜索书名。至少覆盖:
- 书名及书名号形式;
- 书名+作者、出版社、译者;
- 书名+核心卖点、传播母题、争议词;
- 书名+推荐、读后感、书评、避雷、难读、翻译;
- 达人名+书名组合词(强制,2026-09 实战教训):头部博主的带货视频文案经常不写书名,只有 #哲学 #好书分享 这类泛标签——纯书名检索会系统性漏掉平台最高赞的爆款。案例:某书 3.3 万赞头部视频,书名关键词检索两轮都没命中,"达人名+书名"组合词一次命中。做法:第一轮书名词跑完后,从结果和用户指认中收集头部达人名单,第二轮用"达人名+书名"定向补检;
- 作者/IP 名单独检索(作者大 V 的历史内容是流量池,也是同 IP 竞品书的监测面);
- 用户点名的达人、标题、名人或内容概念;
- 搜索过程中发现的新高频词,再反向补检。
对每个关键词在平台内向下浏览多屏,记录结果并去重。不得从首页随便挑几条代替系统检索。
相关性分级规则(强制):一条内容是否相关,只看标题+正文是否实际提到书名或作者,不看检索词是否命中——"达人名+书名"组合词命中的粉丝向内容、同名词内容都是噪音。分三级:强相关(标题/正文含书名)、IP相关(仅含作者名,作流量池/竞品联动参考)、噪音(丢弃)。例外通道:用户指认或人工点开核验确认相关的(如文案不带书名的头部爆款),可升级为强相关,核验层级标"待核验"并在备注写明依据。
2. 识别爆款和关键案例
综合互动量、收藏/分享、评论讨论度、传播角度和用户指定线索选择案例。优先级:
- 平台内明显头部互动内容;
- 用户点名或行业复盘中关键案例;
- 能代表不同内容类型与传播角度的案例;
- 强负评或高讨论度反向案例。
图文平台优先检查点赞超过 1000 的笔记,同时保留虽未过 1000 但具有关键传播切角的案例。短视频平台不得漏掉最高互动视频,并覆盖真人口播、混剪、图文三类内容形式。
3. 核验内容和前台数据
为每条记录标注核验层级:
详情已核验:进入详情页,核对正文、图片或视频及互动数;逐段核验:视频拖动时间轴核看多个节点;API采集核验:经平台登录态接口结构化采集,标题/正文/互动数/精确发布日期/原链来自接口返回且原链可溯(结构化采集路线的默认层级);搜索卡片核验:只确认搜索卡片上的标题、日期和点赞;用户指定待核验:用户确认其重要性,但当前未稳定命中原帖(如文案不带书名、需人工点开确认内容指向的案例)。
缺失的收藏、评论、分享或发布日期留空,不推算、不借用相似账号数据。
案例拆解
一案一拆(强制):产品引入、价值表达、CTA、封面、配图要点等定性拆解列,必须基于该案例真实看到的标题、正文、配图、评论区逐案撰写。严禁用同一套通用模板话术填充所有案例行——重复模板是用户一眼识破的交付事故。封面等未单独截图的元素,如实标注"基于详情页推断",不冒充已核验。
图文笔记
依次拆解:
- 标题;
- 正文第一段;
- 产品如何引入;
- 产品价值如何表达;
- 最后的 CTA;
- 封面构图、封面文案;
- 配图数量、顺序和内容类型;
- 前台点赞、收藏、评论和来源链接。
如果只看到了搜索卡片,只写已确认信息,并明确"待详情补核"。
短视频
必须真实播放或拖动时间轴,不得根据标题臆测分镜。至少观察:
- 0—3 秒:画面、人物、书封、字幕和口播钩子;
- 3—8 秒:如何承接钩子、是否露书;
- 中段至少 3 个均匀分布的时间点:讲解逻辑、镜头变化、字幕和产品价值;
- 最后 5—10 秒:结论、口播 CTA、商品卡、评论引导或其他促单方式。
记录总时长和观察时间点。区分真人口播、混剪和图文,不要用同一套结构强行描述三种形式。
图文卡片(视频形态)
按首图钩子、标题/文案、连续图卡逻辑、产品引入、价值表达、末图 CTA 和商品链路拆解。
营销时间轴
按月份汇总当前可见并去重的相关样本,至少包含:
- 可见样本数;
- 阶段判断;
- 主要传播角度;
- 代表案例;
- 证据强度和待补项。
时间轴模块顶部必须写一句"结论先行",直接说明:
- 集中营销从几月到几月;
- 集中期当前可见铺稿量约多少条/月;
- 长续维稳从几月到几月;
- 维稳期当前可见铺稿量约多少条/月。
统一使用"当前可见样本/约数"口径,除非拥有平台全量数据,不得称为真实总发稿量。
用户反馈
同时整理正向、负向和专业/中性反馈。优先归纳重复出现的具体概念,而不是只写"喜欢""不好看"。
每个主题包含典型表达概括、出现位置、频率判断、营销意义、风险或机会、建议动作和证据来源。重点检查:
- 高频传播母题是否同时出现在标题、正文和评论;
- 抽象难懂、翻译不顺、过度承诺等阅读门槛;
- 收藏、购买询问和版本比较;
- 强负评是否可能形成反向传播。
达人名单
将达人名单放在每个平台的最后一个模块。每个平台目标约 20 位,尽可能覆盖当前检索中靠前且相关的账号,而非少量精选。
名单至少包含账号、代表内容、日期、代表互动、内容形式、核心切角、核验状态、优先级、合作/用途判断和备注(列结构见 Excel 模板)。短视频平台名单保持真人口播、混剪、图文和负评监测的类型平衡。
数量不足时的降级处理:系统检索后确实凑不满目标数量时,如实写入实际找到的位数、已覆盖的检索词和浏览深度,并在模块说明行写明缺口原因;不得用弱相关账号充数,不得重复计数。
Excel 交付
一模块一 Sheet(强制,2026-09-08 定版):每个目标平台 4 个 Sheet——爆款案例拆解、营销时间轴、用户反馈、达人 List,tab 名格式「平台|序号 模块名」(如 平台A|1 爆款案例拆解,平台A/B指用户指定的不同平台)。禁止把四个模块纵向堆进一个 Sheet——多模块共列宽必然导致部分模块挤成一团。
双平台同时分析时的排布(强制):
- 交错排序:tab 顺序按模块交错——平台A①、平台B①、平台A②、平台B②……保证首屏 tab 栏同时露出两个平台,避免用户误以为后面没有另一个平台的内容;
- tab 颜色区分平台:每个平台固定一种 tab 色(如平台A红
C0392B、平台B深蓝2C3E50),tab 被折叠后仍可一眼分辨归属。
呈现层统一收口(完整规范见 Excel 模板):
- 全表统一字体(微软雅黑),表头深底白字居中,关闭网格线,缩放 90%;
- 链接列禁止放原始长 URL(撑爆行高+视觉灾难)——统一转短文本超链接,文案按平台区分:图文平台「打开笔记 ↗」、短视频平台「打开视频 ↗」,点击跳原帖;
- 行高按内容估算并封顶(上限约 96px),禁止长文本把行高撑到半屏;
- 重点浅金标注:每张 Sheet 的核心列/行用浅金底色
FFF2CC标出(默认:案例表的标题/钩子/封面或价值列、时间轴"集中投放"阶段整行),让用户打开即见本表重点; - 正向反馈暖色块、负向冷色块、交替底色保留,不与重点金冲突。
各模块的列结构、表头文案以 Excel 模板 为准,不要每次自行发明列。
结构硬规则(逐条强制,2026-09-08 二次实测后内联——只写在参考文件里的规则会被执行端忽略):
- 表头固定在第 3 行:每个 Sheet 第 1 行=模块标题横幅(深底白字),第 2 行=口径说明行(浅色底、合并整行),数据从第 4 行起。禁止表头裸露在第 1 行;
- 列名逐字复用模板,禁自创、禁缩水、禁换序。模块一(20 列):序号/核验层级/采集日期/发布日期/账号/账号链接/内容形式/标题/钩子/产品引入方式/价值表达/CTA促单/封面首图/配图或分镜要点/点赞/收藏/评论/分享/证据截图/备注。模块二(7 列):月份/当前可见样本数/阶段判断/主要传播角度/代表案例/证据强度/待补项。模块三(9 列):方向/反馈主题/典型表达概括/出现位置/频率判断/营销意义/风险或机会/建议动作/证据来源。模块四(12 列):序号/账号/账号链接/代表内容/日期/代表互动量/内容形式/核心切角/核验状态/优先级/合作/用途判断/备注。"结论先行"放第 2 行说明行,不占数据行;
- 排版收口直接复用附带脚本 excel_style_pass.py(横幅/表头/冻结/URL 短链接/行高封顶/重点金/tab 颜色一站式),不要手写样式代码复刻。
导出后必须:
- 渲染各 Sheet 的预览图并目视检查;
- 检查截断、重叠、空白异常和模块顺序;
- 抽查定性拆解列(产品引入/价值表达/CTA/封面/配图)是否存在跨行雷同的模板话术,雷同即回炉重写;
- 扫描公式错误;
- 检查呈现层:无裸长 URL、重点底色已套用、tab 交错排序与颜色正确、无失控巨行;
- 核对每个平台达人名单数量与降级说明(目标约 20 位);
- 确认所有未核实信息均已标注,关键案例已有证据截图。
最终交付 .xlsx,并简要说明已核验范围、关键缺口和不能外推的口径。
微信扫一扫