Skip to content

ThWink/XHShu

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

1 Commit
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

小红书达人数据分析系统

本项目用于演示“输入产品关键词 -> 搜索小红书相关笔记 -> 提取达人入库 -> 数据分析 -> 推荐适合合作的达人”的完整本地流程。

快速启动

cd C:\小红书达人数据分析
$env:PYTHONPATH='src'
python -m redbook_mvp seed-demo
python -m redbook_mvp serve --port 8765

打开:

http://127.0.0.1:8765

页面里可以直接输入产品,例如“蛋白粉”,核心流程按钮:

  1. 生成产品画像:生成产品卖点、目标人群、小红书搜索关键词和达人筛选策略。
  2. 数据采集:调用小红书采集脚本,把搜索到的达人和笔记写入本地库。
  3. 分析数据:基于产品画像、达人内容和互动数据输出推荐达人。
  4. 智能流程:自动完成“AI 生成首轮关键词 -> 采集 -> AI 评估采集质量”,如果质量不够,页面展示第二轮关键词,必须由用户确认后才会继续采集并输出最终推荐。

AI 产品画像

“生成产品画像”会优先调用 AI 生成卖点、人群、关键词和找博主策略。生成出来的是候选建议,页面会默认填入输入框;你可以点击画像卡片里的建议项来取消或重新加入,也可以直接编辑输入框。最终采集和分析只使用输入框里保留的内容。

“分析数据”也会优先调用 AI。大模型会读取产品卖点、目标人群、达人简介、来源关键词、笔记标题和互动数据,返回推荐等级、匹配分数、推荐理由、合作主题和风险备注。本地规则只在 API 不可用时兜底。

为避免一次分析调用过多 API,系统默认先粗筛候选,再把前 30 个达人交给 AI 复核。可以在 api_config.json 里加 recommendation_limit 调整数量。

“智能流程”会多调用一次 AI 做采集质量评估。评估重点是候选达人是否真的垂直、A/B 级达人是否足够、有没有品类跑偏。如果质量不足,AI 会生成第二轮关键词;系统不会自动无限采集,必须等用户确认后再跑第二轮。

推荐有两个必要条件:

  • 粉丝数低于 1 万,或未采集到粉丝数,默认不进入 A/B 推荐。
  • 达人内容必须有自用、真实体验、真实使用场景或持续垂直内容。比如电竞椅优先找打游戏、电竞房、游戏桌搭、久坐电脑椅真实体验类博主;泛家居、泛好物但看不出自己用过的账号会降为 C。
  • 推荐卡片会展示小红书号、粉丝数、来源关键词和主页链接,避免同名达人混淆。

所有产品都会按“产品 -> 使用者 -> 使用场景 -> 内容话题 -> 平台流量词”推导关键词,而不是只搜“产品名 + 测评/推荐”。例如电竞椅会联想到热门游戏、游戏主播、电竞房和久坐桌搭;乳胶枕头会联想到睡眠质量、卧室改造、睡前放松和家居博主;一次性筷子会联想到外卖打包、露营野餐、办公室午餐和小餐饮开店。

如果没有配置 AI 接口,系统会显示“本地兜底”,并用少量本地规则保证流程可跑。

推荐复制项目根目录的 api_config.example.jsonapi_config.json 后填写本地密钥。api_config.json 已加入 .gitignore,不要上传真实 API Key。

{
  "api_key": "你的 API Key",
  "api_url": "https://api.openai.com/v1/chat/completions",
  "model": "gpt-4o-mini",
  "recommendation_limit": 30
}

也可以用环境变量覆盖配置文件:

$env:OPENAI_API_KEY='你的 API Key'
# 可选:如果使用 OpenAI 兼容接口
$env:AI_PROFILE_API_KEY='你的兼容接口 Key'
$env:AI_PROFILE_API_URL='https://api.openai.com/v1/chat/completions'
$env:AI_PROFILE_MODEL='gpt-4o-mini'
python -m redbook_mvp serve --port 8765

关键词不是简单用“产品名 + 测评/推荐”。主流程会优先使用使用场景、目标人群和内容方向,例如白灼汁会生成“白灼虾”“白灼菜心”“减脂餐蘸料”“快手家常菜”,乳胶枕头会生成“睡眠质量”“护颈枕”“侧睡枕头”“卧室好物”。“产品名测评/推荐”这类词更适合竞品分析,不作为找合作达人的主关键词。

真实采集

真实采集会调用本机已有的小红书技能脚本。默认是保守模式:最多前 3 个关键词、每词 5 条、关键词之间等待 3 秒。页面会强制补充达人主页粉丝数,因为推荐逻辑会过滤 1 万粉丝以下或粉丝数未知的达人。

C:\Users\28794\.codex\skills\xiaohongshu-skills\scripts\cli.py

需要满足:

  • Chrome 已登录小红书
  • 小红书技能依赖可用
  • 单次关键词数量和采集条数不要太高

命令行采集示例:

cd C:\小红书达人数据分析
$env:PYTHONPATH='src'
python -m redbook_mvp collect --product 麦片 --keywords "减脂早餐,健身早餐,燕麦片" --limit 5 --max-keywords 3
python -m redbook_mvp analyze --product 麦片

命令行如需补充粉丝数、简介和地区,可以少量使用:

python -m redbook_mvp collect --product 麦片 --keywords "减脂早餐" --limit 3 --max-keywords 1 --enrich-profile

出现“安全验证 / 请勿频繁操作 / 稍后重试”时,先停止采集,等待一段时间后再用更少关键词重试。

主要文件

  • src/redbook_mvp/keywords.py:关键词扩展
  • src/redbook_mvp/agent_flow.py:智能流程里的采集质量评估和二轮关键词生成
  • src/redbook_mvp/xhs_adapter.py:小红书 CLI 采集适配
  • src/redbook_mvp/storage.py:SQLite 入库和查询
  • src/redbook_mvp/scoring.py:匹配评分和推荐理由
  • src/redbook_mvp/server.py:本地网页 API
  • web/:本地工作台页面
  • docs/小红书达人库PRD.md:PRD 和工作流程

About

No description, website, or topics provided.

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages