
我开源的 xiaohongshu-note-material-pack-free,是给 Agent 用的一份只读工作说明:输入一篇指定笔记的 URL 和已登录的 Easy WebBridge 浏览器环境,把页面实际看得到的内容整理成资料包,留住来源,也把看不到的地方标出来。
它不是批量爬取器,也不会把别人的笔记改写后发布。内容是否可见,取决于页面当时的登录状态、权限和平台展示;被折叠、遮挡或要求验证的部分就列为缺项。
一篇笔记,最后整理出什么
资料包面向后续选题归档和引用核对,包含笔记标题、作者、正文要点、图片说明、精确来源链接和缺项列表。它只记录浏览器页面中真实可见的内容,不推断作者没写出的背景,也不把没有加载出来的图当成已经看过。
仓库里的离线样例有一个明确标注的模拟标题"周末收纳清单",两条模拟正文要点和两张图片说明:第一张说明可见,第二张说明缺失。样例输出会保留第二张图片的"缺项"状态。这只是固定样例,用来检查资料包格式,不是实际采集的笔记。
从页面到 Markdown 的流程
实际使用时,先指定一篇笔记和正确的 browserId。Agent 在对应浏览器里只读页面可见字段,整理成结构化 JSON,再交给仓库中的 Node 脚本生成 Markdown。脚本会核对来源 URL 是否被明确标记为已验证;离线样例没有真实 URL 时,会写明"离线资料模拟未验证真实页面 URL"。
正文要点、图片说明和缺项会逐项保留。图片说明为空、图片不可见或超过单批处理上限时,输出会记录缺少说明或尚未处理的范围,不会悄悄删掉这些信息。
这个流程适合为单篇笔记建立引用索引:先把看得到的材料存清楚,再判断是否值得进一步研究。它不替代创作判断,也不负责把资料转换成新文章。
使用前要知道的边界
仓库依赖 Easy WebBridge 提供已登录浏览器页面;仓库本身不登录、不绕过验证码、不访问隐藏数据。它不下载或转存图片,不提取不可见正文,不自动发布,也不负责从关键词搜索出一批笔记。
本次核验的 1.0.1 仓库包含 Skill 说明、README、固定样例和一个离线格式整理脚本。自检通过说明这些文件和样例合同符合预期,不证明真实账号采集成功,也不代表页面内容可以任意转载。
项目入口:https://github.com/xxjrq/xiaohongshu-note-material-pack-free
核验记录:2026-10-09;公开 main 提交 39bfbcc2e1f6cd8ffe3bfbbe8db1ef5e04e77c8f,MIT。页面访问范围与素材权利仍需逐篇确认。