我的开源项目:小红书笔记归档,把来源和缺项一起留下

我开源的 xiaohongshu-note-material-pack-free,是给 Agent 用的一份只读工作说明:输入一篇指定笔记的 URL 和已登录的 Easy WebBridge 浏览器环境,把页面实际看得到的内容整理成资料包,留住来源,也把看不到的地方标出来。

它不是批量爬取器,也不会把别人的笔记改写后发布。内容是否可见,取决于页面当时的登录状态、权限和平台展示;被折叠、遮挡或要求验证的部分就列为缺项。

一篇笔记,最后整理出什么

资料包面向后续选题归档和引用核对,包含笔记标题、作者、正文要点、图片说明、精确来源链接和缺项列表。它只记录浏览器页面中真实可见的内容,不推断作者没写出的背景,也不把没有加载出来的图当成已经看过。

仓库里的离线样例有一个明确标注的模拟标题"周末收纳清单",两条模拟正文要点和两张图片说明:第一张说明可见,第二张说明缺失。样例输出会保留第二张图片的"缺项"状态。这只是固定样例,用来检查资料包格式,不是实际采集的笔记。

从页面到 Markdown 的流程

实际使用时,先指定一篇笔记和正确的 browserId。Agent 在对应浏览器里只读页面可见字段,整理成结构化 JSON,再交给仓库中的 Node 脚本生成 Markdown。脚本会核对来源 URL 是否被明确标记为已验证;离线样例没有真实 URL 时,会写明"离线资料模拟未验证真实页面 URL"。

正文要点、图片说明和缺项会逐项保留。图片说明为空、图片不可见或超过单批处理上限时,输出会记录缺少说明或尚未处理的范围,不会悄悄删掉这些信息。

这个流程适合为单篇笔记建立引用索引:先把看得到的材料存清楚,再判断是否值得进一步研究。它不替代创作判断,也不负责把资料转换成新文章。

使用前要知道的边界

仓库依赖 Easy WebBridge 提供已登录浏览器页面;仓库本身不登录、不绕过验证码、不访问隐藏数据。它不下载或转存图片,不提取不可见正文,不自动发布,也不负责从关键词搜索出一批笔记。

本次核验的 1.0.1 仓库包含 Skill 说明、README、固定样例和一个离线格式整理脚本。自检通过说明这些文件和样例合同符合预期,不证明真实账号采集成功,也不代表页面内容可以任意转载。

项目入口:https://github.com/xxjrq/xiaohongshu-note-material-pack-free

核验记录:2026-10-09;公开 main 提交 39bfbcc2e1f6cd8ffe3bfbbe8db1ef5e04e77c8f,MIT。页面访问范围与素材权利仍需逐篇确认。

相关推荐
海海不掉头发1 小时前
图论及其应用_课堂笔记整理_CSDN博客
笔记·图论
志尊宝1 小时前
Vue3 零基础每日笔记(075):图片懒加载与骨架屏
javascript·vue.js·笔记
会博通·代码搬运工1 小时前
家装数字化交付笔记:图纸归档、工地采集与档案系统对接的工程实践
笔记·数字化转型·档案管理系统·业务档案系统·家装数字化
Code_Solitude2 小时前
高数第一章函数笔记(原稿手写+AI识别优化)
人工智能·笔记
imDwAaY3 小时前
MCP 到底是什么?大模型如何连接外部工具与数据?
笔记
深圳老胡3 小时前
STM32F4 OTA 升级双 App 方案设计与实现
笔记·stm32·单片机·代码规范
陈年老古董3 小时前
Hive 分区表学习笔记:语法、操作、二级分区与动态分区
hive·笔记·学习
商业白皮书4 小时前
2026年上海豆包DeepSeekKimi百度AI通义千问GEO服务商选择
人工智能·笔记
存在morning4 小时前
【OLAP 学习笔记】Doris:数据湖之上的分析查询引擎
笔记·学习