2026 年职场效率差距,可能就藏在这些办公场景 Agent Skills 里


Agent Skills 图鉴:十五件给 Agent「长本事」的利器

想象你刚招进一名能力极强的实习生:写代码、做分析、润色文案样样都行,唯独不了解你手头的具体规矩------PPT 要用哪套母版、专利交底书分哪几步、周报忌讳什么腔调。你要做的不是教他重新学习,而是递给他一本岗位手册。

Agent Skill 就是这本手册。一个 SKILL.md 文件,外加按需取用的脚本、参考文档和模板,打包成一个文件夹,Agent 读到它,就「学会」了一门手艺。Anthropic 自己的官方博客用的也是同一个比喻:给 Agent 写 Skill,就像给新员工写入职手册。这形态于 2025 年 10 月由 Anthropic 提出,同年 12 月在 agentskills.io 成为开放标准,随后被 Claude Code、Codex CLI、Cursor 等四十余款 Agent 客户端共同采纳,官方参考仓库一年内攒下逾 6 万 Star ------ 本文收录的 15 个技能,就是这个生态里最有代表性的标本:有的出自 Anthropic、Vercel Labs 官方,有的出自个人开发者,在 GitHub 上拿过数万 star,也有的刚刚上架、鲜为人知。

它们放在一起看,恰好回答了一个更大的问题:当我们说「让 Agent 学会做一件事」时,到底在做什么。

阅读之前:两条背景知识

读懂这些条目,只需要先理解两个所有 Skill 共有的机制:

  1. 触发全靠一句话 。每个 SKILL.md 的 frontmatter 里有一个 description 字段,它随技能名单常驻 Agent 上下文,Agent 每轮对话都会拿用户的请求和它做语义匹配------匹配上就翻开手册,匹配不上就当它不存在。所以你会发现,「触发条件怎么写」几乎是每个技能最较劲的地方。
  2. 内容按需加载(渐进式披露)。上下文窗口是稀缺资源,所以成熟的做法是:元数据常驻、正文触发时才读、脚本和参考文档用到才翻。技能作者们管这个叫 progressive disclosure。

每个条目遵循同一模板:来源核心功能 (总述 + 编号能力点)→ 触发条件前置条件 / 边界与约束 (可选)→ 标签。15 个条目按职能分为五章:

章节 收录
一、生态基石:造技能、找技能、把话问明白 skill-creator、find-skills、clarify-intent
二、办公室重活:文档、表格与 PPT ppt-master、OfficeCLI、anydoc-to-markdown、theme-factory
三、让数据开口说话 smart-charts、archify
四、向外求索:资讯、调研与浏览器 ai-radar、unifuncs-deep-search、unifuncs-deep-research、agent-browser
五、垂直场景:专利与汇报 patent-disclosure-skill、work-report-pro

第一章 生态基石:造技能、找技能、把话问明白

生态要转起来,得先有三样基础设施:一个教你怎么造技能的技能、一个帮你找技能的技能,以及一个在你动手之前先把需求问清楚的技能。这三件恰好都在。

1. skill-creator:造技能的技能

来源anthropics/skills · skill-creator(Anthropic 官方技能仓库)

如果把 Skill 生态比作一座工厂,skill-creator 就是产房本身------它是 Anthropic 官方仓库里的元技能(meta-skill),不直接解决业务问题,而是覆盖其他 Skill 的生产、评测、迭代与分发全链路。它也是理解「一个认真的 Skill 应该长什么样」的最佳范本:官方把「测试驱动迭代」写进了技能的血脉,而不是把 SKILL.md 当一次性提示词。

核心功能

  1. 创建 Skill ------ 以 4 问捕获意图(做什么 / 何时触发 / 输出格式 / 是否需要测试用例),产出 SKILL.md 四件套:namedescriptioncompatibility(可选)与正文指令。资源按「渐进式披露」三级分层:元数据常驻上下文(约 100 词)→ 正文在触发时加载(500 行以内)→ scripts/(确定性任务代码)、references/(按需读入的文档)、assets/(进入产出物的模板 / 字体 / 图标)按需加载。
  2. 量化评测闭环(主体工作量) ------ 编写 2--3 个真实测试 prompt(evals/evals.json)→ 同一轮内并发启动 with-skill 与 baseline(新技能以「无技能」为基线,改旧技能以「改动前快照」为基线)→ 运行期间同步草拟断言、逐个落盘 timing.json(token 与耗时只在任务通知中出现一次)→ grader 子 agent 判定断言并写入 grading.json(字段名硬约束为 text / passed / evidence)→ scripts/aggregate_benchmark.py 聚合出 pass_rate、耗时、token 的 mean ± stddev 与配置间 delta → 分析师复盘(剔除无区分度断言与高方差 flaky 用例,权衡时间与 token)→ eval-viewer/generate_review.py 启动本地评审页(--static 输出独立 HTML)→ 人工反馈落入 feedback.json → 改进 → 进入下一轮迭代。
  3. 改进既有 Skill(4 条方法论) ------ 从反馈泛化(拒绝过拟合到少数样本,目标是可复用百万次的技能);保持 prompt 精简(须读 transcript,不只看产出);解释 why 而非全大写 MUST(明确列为黄灯信号);从跨用例重复劳动中抽取 bundled script(若 3 个用例各自写了同一脚本,即为收编信号)。终止条件:用户满意 / 反馈全空 / 无实质进展。
  4. 触发描述优化(独立子流程) ------ 生成 20 条拟真 query(8--10 条正例 + 8--10 条 near-miss 负例,禁止一眼无关的废题)→ 用 assets/eval_review.html 交用户审核 → scripts/run_loop.py 执行闭环:60/40 train/test 切分、每条 query 跑 3 次测触发率、调用 claude -p 迭代改进最多 5 轮,按 test 分而非 train 分选取 best_description 以抑制过拟合。
  5. 打包分发 ------ scripts/package_skill.py 产出 .skill(zip 格式);打包时自动调用 quick_validate.py 校验 frontmatter(键名白名单:name / description / license / allowed-tools / metadata / compatibility),并排除 __pycache__node_modules*.pyc.DS_Store 及根级 evals/
  6. 盲测 A/B 对比(高级可选) ------ 独立 comparator 子 agent 在不知 A/B 归属的前提下判优,analyzer 子 agent 揭盲归因。官方标注为可选,人工评审通常已足够。
  7. 三平台降级适配 ------ Claude Code(子系统完备:子 agent 并发 + 浏览器评审 + 描述优化);Claude.ai(无子 agent → 自行串行执行,跳过 baseline / benchmark / 描述优化 / 盲测);Cowork(有子 agent 无显示 → 以 --static 输出 HTML,feedback.json 下载回传)。

触发条件

  • 触发机制 :唯一入口为 frontmatter 的 description 字段,随 name + description 进入 Claude 的 available_skills 列表,由 Claude 每轮自主判断是否查阅。

  • 判定门槛 :Claude 仅对自身不易独立完成的复杂、多步、专门化任务才查阅 skill。因此「读个文件」这类单步请求即使描述完美匹配也不会触发------这也是其 eval query 设计规范中明令排除 read file X 类用例的原因。

  • 5 类触发信号

    场景 典型表述
    从零创建 skill 「帮我做个 skill」/「把这个流程做成 skill」/ "turn this into a skill"
    编辑或优化已有 skill 「改一下这个 skill」/ "optimize my skill"
    运行 eval 测试 skill 「跑一下测试看这 skill 行不行」/ "run evals"
    基准测评与方差分析 「benchmark 一下效果」/「新版比旧版好吗,有数据吗」
    优化 description 提升触发准确率 「这 skill 老是不触发」/ "improve triggering accuracy"
  • 平台附加条件 :在 Claude.ai 上触发后,描述优化、盲测、benchmark 三个子流程不可用(缺子 agent 与 claude CLI),仅保留串行自测 + 对话内定性评审。

边界与约束

SKILL.md 明令安全底线:不得包含恶意代码或危害系统安全的内容,其行为不应在意图上令用户意外;同时显式排斥同类测试技能("Do NOT use /skill-test or any other testing skill")。

标签

  • meta-skill:定位为 "A skill for creating new skills and iteratively improving them",即生产其他 skill 的 skill
  • skill-authoring:意图捕获 → SKILL.md 四件套 → 渐进式披露三级资源组织 → 打包分发,构成完整创作链路
  • eval-driven-iteration:测试 → 判分 → 聚合 → 人工评审 → 改进的闭环占据 SKILL.md 近半篇幅,被官方称为 "the heart of the loop"
  • trigger-optimization:20 条拟真 query + train/test 切分 + 3 次重复测触发率,是辨识度最高的独立子流程
  • benchmarking:frontmatter 明写 "benchmark skill performance with variance analysis",产出含 mean ± stddev 与 delta 的量化基准

2. find-skills:技能界的「导购员」

来源vercel-labs/skills · find-skills(Vercel Labs 官方技能仓库)

生态里有了成千上万件兵器,下一个问题自然是:怎么找到合手的那件?find-skills 是 Vercel Labs 给出的答案------它本身不提供任何业务能力,而是教会 Agent 在用户需要某项能力时,去开放生态中检索、筛选并代装现成技能。它背后的生态入口是 skills.shnpx skills CLI:一个按安装量排名的技能榜单,一套跨客户端的标准安装命令。

核心功能

执行流程为六步:

  1. 需求解析 ------ 从用户诉求中提取领域(React / 测试 / 设计 / 部署)、具体任务,以及是否属于「已有现成技能」的通用任务。
  2. 先查榜单 ------ 优先查 skills.sh 排行榜(按安装量排名),命中高口碑技能则跳过检索。
  3. 关键词检索 ------ 执行 npx skills find [query] [--owner <owner>],使用具体关键词(如 react testing 而非 testing),并尝试同义词替换。
  4. 质量核验 ------ 明确禁止仅凭搜索结果推荐:核查安装量(优先 1K+,100 以下慎用)、来源信誉(vercel-labsanthropicsmicrosoft 等官方源优先)、源仓库 GitHub Star(低于 100 星存疑)。
  5. 结构化呈现 ------ 输出技能名与用途、安装量与来源、安装命令、skills.sh 详情链接。
  6. 代为安装 ------ 用户确认后执行 npx skills add <owner/repo@skill> -g -y-g 全局安装,-y 跳过确认)。

兜底策略:未检索到匹配技能时如实告知,并提议直接用通用能力完成任务,或建议用户以 npx skills init 自建技能。

触发条件

用户以「如何做 X」「有没有能做 X 的技能」「你能做 X 吗」等形式提出可能已有现成技能的任务;表达想扩展 Agent 能力;想搜索工具 / 模板 / 工作流;提到自己希望在某领域(设计、测试、部署等)获得帮助。核心判据:用户所需功能可能已存在可安装的技能,而非普通问答或纯编码任务。

标签

  • skill-discovery:技能发现
  • skill-installation:技能安装与落地
  • skills-cli:基于 skills CLI 检索与安装
  • agent-capability-extension:Agent 能力扩展
  • quality-verification:安装量 / 来源 / Star 三重质量核验

3. clarify-intent-and-establish-shared-understanding:先问明白,再动手

来源Inference1/clarify-intent-and-establish-shared-understanding

大多数 Agent 事故不是因为做错了,而是因为做对了错误的事。这个技能干的就是「踩刹车」的活儿:在执行任何有后果的操作之前,通过结构化、逐轮加深的追问,把用户模糊的意图锻造成双方共享的精确理解------它的 description 里甚至造了个词:super-alignment(超级对齐)。它把「追问」这件事本身工程化了:不是随口一问,而是一套带状态的决策树遍历算法。

核心功能

  1. 决策树 + 前沿(frontier)推进 ------ 将用户的目标 / 计划 / 决策建模为一棵隐式决策树,每轮只提问「前提已被解决」的问题(即当前前沿);一轮内一次性给出全部前沿问题,逐条编号,并为每问附推荐答案;用户未作答前不进入下一轮。每轮的输出格式被固定为 ❓ Q1 ...... ➡️ 推荐答案 的卡片样式。
  2. 答案驱动重构 ------ 答案会重塑决策树并重算前沿,解锁依赖型问题;依赖于本轮其他未决问题的提问,推迟到后续轮次。
  3. 事实自查 ------ 可自行获取的事实(代码库、文件、工具、已连接数据源)直接检索验证,只把人类判断、偏好、优先级、风险容忍度留给用户。
  4. 共识管理 ------ 持续复述并精炼共识,严格区分事实 / 假设 / 猜想 / 未知,暴露矛盾、缺失约束与模糊验收标准。
  5. 硬性闸门 ------ 以下四条全部满足前不得行动:(1) 相关决策、依赖与约束已解决;(2) 期望结果与可度量的成功判据已明确;(3) 主要假设与权衡已摆上台面并被接受;(4) 用户明确确认已达成共享理解。未满足时,禁止执行、实现、修改、提交、发布或定稿任何有后果的产出。
  6. 设计取向 ------ 以第一性原理为底座,用交互(多轮对话)替代扩张搜索空间;严格但建设性,在严谨性与效率间取平衡,避免过度盘问。

触发条件

  • 显式触发:用户明确要求严苛审视------拷问(grilling)、挑战、压力测试、交叉质证、红队评审、事前验尸(pre-mortem)、决策审计。
  • 适用情境:结果质量取决于「动手前是否把问题定义准确」的场合------目标设定、战略与方案成型,以及存在模糊目标 / 隐含假设 / 冲突约束 / 证据不足 / 风险未评估的决策。

标签

  • intent-clarification:意图澄清
  • shared-understanding:共享理解与人机对齐
  • decision-tree-frontier:决策树逐轮追问
  • assumption-audit:假设与矛盾审查
  • red-team-review:红队评审 / 事前剖析

第二章 办公室重活:文档、表格与 PPT

Skill 生态里最「卷」的赛道,莫过于办公三件套。这一章的四个技能展示了四种不同的切入姿势:ppt-master 自建整条演示流水线,OfficeCLI 把 Office 文件变成命令行可操作的对象,anydoc 负责把万物的格式统一抹平,theme-factory 则只管最后一步的「穿衣打扮」。

4. ppt-master:演示文稿的整条流水线

来源hugohe3/ppt-master(当前版本 6.4.0,MIT 协议;GitHub 逾 5.3 万 star,仓库创建于 2025 年 12 月;作者 Hugo He 是一位投融资从业者、注册会计师------一个被 PPT 折磨过的内行)

让 AI 做 PPT 的工具一抓一大把,但多数产出的是「图片拼贴」:好看,却一个字都改不动。ppt-master 的野心是做一条真正的生产线:输入文档 / 图片 / 主题,输出原生可编辑的 PPTX------真实 DrawingML 对象(原生形状与连接线、母版 / 版式继承、可「编辑数据」的原生图表与表格、OMML 公式),而非扁平图片或模板填充。主管线:源材料 → Markdown → 规划 → 手写 SVG 页面 → 编译为 PPTX。

核心功能

  1. 三条顶层路由 ------ 由 workflows/routing.md 确定性择一,且明文禁止向用户弹「路线选择菜单」("Forbidden --- route-choice menus"):

    路由 说明
    生成 PPTX 从源材料或纯主题新建 / 视觉重建演示。含三个 profile:Image→PPTX (位图页面帧 → 分层可编辑页,仅 Codex + Quick)、Beautify (文案、页数、顺序 1:1 冻结,只重做版式)、Quick(一次成型,跳过确认门与规划产物)
    创建模板 从 PPTX / SVG / 图片 / PDF / 文档 / 网站 / 品牌资产提炼可复用工作区,四种互斥类型:Brand(识别)、Style(风格方法)、Layout(中性结构)、Deck(场景化整包)
    编辑原生 PPTX 保留既有 PPTX 原生设计:填充新内容、改写或重排指定页、加备注 / 配音 / 计时 / 切换;未改动页经 pptx_to_svg.py --roundtrip 工作区字节级还原
  2. 可选阶段与后处理 ------ 主题研究补全、模板工作区应用、浏览器实时预览(可直接改元素或批注交 AI 重写)、图表校验、视觉评审、页面切换与原生对象动画、TTS 配音(默认 edge-tts 本地免费合成,可选 ElevenLabs / MiniMax / Qwen / CosyVoice 等云厂商或克隆音色)回嵌 PPTX、导出带同步解说的自播放视频(narrated PPTX;MP4 走本机 Windows PowerPoint 2016+ 原生编码,或 ffmpeg 直接混音)。

  3. 输入与画布 ------ 输入格式:PDF、DOCX、PPTX / POTX / PPSX、XLSX、EPUB、HTML、MD / TXT、ipynb、URL、直接粘贴文本、图片;DOC / ODT / RTF / LaTeX / RST 走可选的 Pandoc。画布:PPT 16:9、4:3、小红书、朋友圈 / IG、Story / TikTok、微信头图、Banner、A4 及自定义尺寸等十余种。

  4. 设计定位 ------ Skill 只管工作流,模型定上限(「PPT Master 只负责工作流,产出上限由模型决定」);纯本地运行(除模型通信外数据不出机),无平台 / 模型锁定。

触发条件

依据 SKILL.md frontmatter 的 description(即模型匹配依据)触发:

  • 要求创建 / 生成 / 重建 / 重新生成 / 美化 / 重新设计 / 套模板 / 填充 / 增强一份 presentation、PPT、PPTX、slide deck 或课件;
  • 为演示文稿添加旁白或动画;
  • 要求生成由演示旁白驱动的自播放视频;
  • 直接提及 ppt-master

前置条件

Python 3.10+ 与 pip install -r requirements.txt;入口强制先执行 scripts/attribution_guard.py 完整性闸,非零即中止(且不得绕过);AI 生图 / 图库检索 / 高质量 TTS 需可选 API Key(缺省可零配置降级);Image→PPTX 路由强制要求 Codex。

标签

  • pptx-generation:原生 PPTX 生成
  • ai-agent-skill:Agent 技能包
  • document-to-deck:文档转演示文稿
  • drawingml-native:原生 DrawingML 对象,非扁平图片
  • presentation-templating:演示模板提炼与复用

5. OfficeCLI:Office 文档的「全科医生」

来源iOfficeAI/OfficeCLI(单一二进制 CLI,免费下载,macOS / Linux 一键安装,Windows 走 Releases)

ppt-master 自建流水线,OfficeCLI 则走另一条路:把 Word / Excel / PowerPoint 三种格式彻底「命令行化」------文档的每一节、每一行、每一个单元格,都变成可以增删改查的对象。技能包只是它的「场景说明书」,真正的引擎是那个二进制。

核心功能

以单一二进制 CLI + 场景化技能包,对三种格式执行全生命周期操控。

  1. 三格式全生命周期操控 ------ 读:create / view(outline · stats · issues · text · annotated · html · screenshot · svg · pdf · forms)/ get / query(CSS 式选择器)/ validate;写:set / add(克隆节点经 add --from <path> 实现)/ remove / move / swap / batch(原子事务,失败即回滚)/ find & replace(含 docx 修订态替换);排序通过 set --prop sort= 属性完成;底层另有 raw / raw-set / add-part 直操作 OOXML。
  2. 按产物类型产出单一交付物 ------ 每个技能对应一个 .docx / .xlsx / .pptx,交付前执行渲染校验与已知缺陷检查,不达标不出门。
  3. 内置渲染引擎闭环 ------ view html / screenshotwatch(实时预览 + 浏览器点选回传路径)让 Agent 能「看见」成稿,形成 render → look → fix 自愈循环,可在 CI / Docker / 无显示环境运行。
  4. 工程化配套 ------ 内建 MCP Server(officecli mcp claude|cursor|vscode|lmstudio)、dumpbatch 结构化往返(学习人类模板)、merge{``{key}} 模板批量填充、350+ Excel 函数与原生透视表引擎、load_skill 按需加载、插件机制扩展 .doc / .hwpx / PDF 导出。
  5. 设计系统内置 ------ morph-ppt 场景技能附带成套命名风格库(含版式规范、配色与构建脚本),同族还有 3D 演示方向的 morph-ppt-3d

触发条件

  • 两条触发通道
    1. 宿主 Agent 技能发现 ------ 安装脚本(install.sh)在首次安装时自动探测本机 Agent 的技能目录并写入 <目录>/skills/officecli/SKILL.md。探测清单共 10 类:Claude Code(~/.claude)、GitHub Copilot(~/.copilot)、Codex CLI(~/.agents)、Cursor(~/.cursor)、Windsurf(~/.windsurf)、MiniMax CLI(~/.minimax)、OpenClaw(~/.openclaw)、NanoBot(~/.nanobot/workspace)、ZeroClaw(~/.zeroclaw/workspace)、Hermes Agent(~/.hermes)。随后由宿主 Agent 按 frontmatter description 中的触发词自动匹配。
    2. 工具内按需拉取 ------ MCP 工具描述常驻一条精简触发摘要(指令式:「对任何 Office 文件执行 create / add / set / remove 之前,先运行 load_skill <X>」),Agent 调用 load_skill <name> 即打印完整 SKILL.md 并遵循其规则。
  • 触发词写在 frontmatter description ------ 正向列举 Trigger on: 'deck' / 'slides' / 'presentation' / 'financial model' / 'DCF' / 'pitch deck' / 'thesis' / 'APA' / 'morph' / 'fillable form' ...;反向以 DO NOT invoke for ... 显式排除近义场景(如 pitch-deck 排除董事会 deck,morph-ppt 排除静态 deck)。
  • 路由规则 ------ 每个产物只加载一个技能(场景层已内联格式基线规则,禁止叠加);取 "When to use" 中最具体者;无匹配则回落格式默认(word / excel / pptx);两个产物 = 两次独立加载;已加载规则跨轮次持续有效。

前置条件

需先安装 officecli 二进制(curl -fsSL https://d.officecli.ai/install.sh | bash),技能方可实际执行;仅加载 SKILL.md 而无二进制时会先引导安装。安装脚本自带不少工程细节:镜像源优先、GitHub 兜底,SHA256 校验,原子替换,macOS 下去隔离标记并校验签名。

标签

  • ai-agent-skills:Agent 技能包
  • office-document-automation:Word / Excel / PPT 自动化
  • officecli-cli:单二进制 CLI + MCP
  • scenario-layer-routing:场景化分层路由
  • on-demand-trigger:按需触发加载

6. anydoc-to-markdown:万档归一的格式「磨平机」

来源firecrawl/anydoc(Firecrawl 出品;技能登记名为 convert-documents-to-markdown,按 agentskills.io 规范分发)

Agent 读得动 Markdown,却读不动 .docx、.pptx、.epub------这是几乎所有文档型任务的第一道坎。anydoc 的思路粗暴而优雅:用纯 Rust 写一套统一文档模型,把 21 种扩展名全部解析进同一个模型,再经同一个序列化器输出 GFM Markdown。格式磨平之后,下游一切皆可用。

核心功能

  1. 全格式统一转 GFM Markdown ------ 覆盖 21 个扩展名 / 8 个格式族:Word(.doc .docx .docm)、PowerPoint(.ppt .pps .pot .pptx .pptm .ppsx .ppsm)、Excel(.xls .xlsx .xlsm .xlsb)、OpenDocument(.odt .ods .odp)、RTF、EPUB、CSV、PDF。所有格式解析进同一个文档模型、经同一个 Markdown 序列化器输出,因此转义、表格、标题锚点、脚注的行为跨格式完全一致。
  2. 结构保真度高 ------ 带锚点标题、粗 / 斜 / 删除线、行内代码与代码块、链接与内部交叉引用、有序 / 无序 / 嵌套 / 任务列表(保留源文档自身编号)、含合并单元格与表头的表格、引用块、脚注尾注、演讲者备注;Word / PowerPoint 的 OMML、ODF / EPUB 的 MathML、RTF 公式统一转 LaTeX($...$$$);嵌入图片与对象渲染为 alt 文本,原始字节保留在文档模型上。
  3. 内容探测格式识别 ------ 依据字节内容特征判定(PDF 头、RTF 开组、OLE 流名、ZIP 包 mimetype),扩展名仅作无签名格式(CSV)的兜底,扩展名标错仍能正确转换。
  4. 零安装、非交互 CLI ------ npx -y @firecrawl/anydoc <file>,默认 Markdown 到 stdout,-o 落盘,- 读 stdin(stdin 无扩展名,CSV 必须 --format csv);一次调用只处理一个文档,永不提示,诊断信息只走 stderr。退出码语义化:0 成功 / 1 文档无法转换 / 2 用法错误 / 3 PDF 需 OCR。
  5. OCR 边界与托管回退 ------ 本地不做 OCR;纯文本 PDF 可离线转换,扫描件 / 纯图片页以退出码 3 拒绝,此时 --ocr hosted 将整份文档送往 Firecrawl Parse(无需注册,--api-keyFIRECRAWL_API_KEY 提升限额,--api-url 指向自建部署)。仅需 OCR 的文档会离开本机------这条边界被显式写进文档,而非藏在行为里。
  6. 库绑定优先于 shell ------ 在 Node / Python / Rust 代码库内应直接调用库而非外包 CLI:npm @firecrawl/anydoc、PyPI firecrawl-anydoccrates.io anydoc、WASM @firecrawl/anydoc-wasm,均暴露同一套 to_markdown / toMarkdown / toDocument API(Node 走 libuv 线程池不阻塞事件循环,Python 释放 GIL)。
  7. 性能 ------ 纯 Rust,无 ML 模型、无外部服务,单文档转换中位耗时 < 5 ms;官方基准中唯一覆盖 14/14 格式,且每个受评格式得分均为最高。

触发条件

  • 触发语义SKILL.md frontmatter description):当任务需要读取 Agent 无法直接读取的办公文档、电子表格、演示文稿、电子书或 PDF 的内容时触发;由宿主 Agent 依据该 description 自动匹配,无需用户显式点名技能。
  • 安装通道npx skills add firecrawl/anydoc(遵循 agentskills.io 规范),兼容 Claude Code、Codex、Cursor、OpenCode 及其他兼容客户端。
  • 上下文策略 :大文档应 -o 落盘后按需读取片段,而非整体灌入上下文(SKILL.md 规则 4 的明确要求)。
  • 不触发 / 回退 :非文档类输入不适用;扫描件 PDF 在未开启 --ocr hosted 时按退出码 3 失败,不产出 Markdown。

前置条件

Node 20+;npx 首次运行会下载对应平台的预编译二进制,无需常驻安装(或 npm install -g @firecrawl/anydoc 获取常驻 anydoc 命令)。

标签

  • document-to-markdown:文档转 Markdown
  • multi-format-conversion:21 个扩展名 / 8 个格式族统一转换
  • agent-skill:Agent 技能,npx 免安装分发
  • firecrawl-parse-ocr:扫描件托管 OCR 回退
  • llm-ready-context:为 LLM / RAG 产出结构化 GFM 语料

7. theme-factory:给制品「一键换装」

来源anthropics/skills · theme-factory(Anthropic 官方技能仓库)

内容做好了,最后一公里的问题是「颜值」。theme-factory 是 Anthropic 官方的极简样本:它不改一个字的内容,只为已生成的制品(artifact)套用统一、专业的视觉主题,让配色与字体保持一致的设计语言。它的 SKILL.md 短得可以一眼读完------证明好技能不一定复杂。

核心功能

  1. 内置 10 套预设主题 ------ 每套包含「带十六进制色值的配色板 + 标题 / 正文字体配对 + 视觉定位说明」:

    主题 风格定位
    Ocean Depths 专业冷静的海事深蓝
    Sunset Boulevard 温暖浓烈的日落色
    Forest Canopy 自然大地色
    Modern Minimalist 简洁当代灰阶
    Golden Hour 浓郁秋日暖调
    Arctic Frost 清冷冬日调
    Desert Rose 柔和灰粉高级调
    Tech Innovation 高对比科技感
    Botanical Garden 清新有机花园色
    Midnight Galaxy 深邃宇宙戏剧感
  2. 按需生成自定义主题 ------ 当预设主题均不适用时,依据用户给出的基本描述即时生成一套新主题(含命名、配色、字体),格式与预设一致。

  3. 固定执行流程 ------ 展示 theme-showcase.pdf 总览 → 询问用户选择 → 等待明确确认 → 读取 themes/<name>.md → 将颜色与字体一致地应用到制品(含对比度与可读性校验)。

触发条件

  • 触发 :用户要求对幻灯片 / 演示文稿、文档、报告、HTML 落地页等制品进行「美化 / 排版 / 换配色 / 统一风格」,或要求为某制品推荐 / 挑选配色与字体方案时,由模型依据 description 自动调用。
  • 典型入口 :常与 pptx 技能配合------先生成幻灯片,再用本技能上色。
  • 不触发:单纯的文字内容写作、代码生成、无需视觉统一的纯数据任务。

标签

  • theming / visual-styling:主题样式
  • slides / pptx:幻灯片演示文稿
  • color-palette:配色方案
  • typography / font-pairing:字体搭配
  • artifact-styling:制品美化

第三章 让数据开口说话

画图谁都会,难的是「别撒谎」。这一章的两个技能都把大量篇幅花在同一个主题上:如何保证图里的每个数字、每条连线都有出处。

8. smart-charts:先算事实,再写解读

来源hherosoul/dsh-smart-charts(技能位于 skills/smart-charts 子目录;v8.0.1,MIT 协议;亦上架腾讯 SkillHub

大多数 AI 画图的翻车现场都一样:图挺漂亮,数字是编的。smart-charts 的应对是把「算」和「说」拆成两个强制步骤------技能只负责算事实,解读文字必须由 Agent 对着统计结果逐字写,且每个数字都要能找到出处。它把数据文件变成带文字解读的交互式 ECharts HTML:本地离线运行,纯 Python CLI,无外部 API、无 CDN 依赖,不需要 API Key。主管线:数据文件 → data_parser.py 解析归一 → LLM 生成 pandas transform 代码(沙箱执行)→ cli.py 渲染 ECharts HTML 并注入文字解读 → stdout 返回结构化 JSON(含 data_preview / plot_stats)。

核心功能

  1. 数据接入与清洗 ------ 输入格式:CSV / TSV / TXT(自动嗅探 , \t ; | 分隔符)、XLSX / XLS、JSON(仅 1 层嵌套,展开为 父.子 点分列);自动识别 UTF-8 / GBK / GB2312 / UTF-16 / Latin-1 编码。脏表头三件套:--skiprows N(跳过前置说明行)、--header-row N(指定第 N 行作表头,适配多行合并单元格)、--sheet(按名或索引选工作表,表不存在时返回可用表清单)。列名规范化:Sales Amountsales_amount销售-额%销售_额、空名 → unnamed;后续 --x-axis / --y-axis / transform 必须引用规范化后的列名。ID 列保护:id / 编号 / 学号 / 邮编 等列及前导零值(007)强制保留字符串,不被静默转成数字。多文件合并:列名完全相同 → 纵向拼接并注入 source_file 列;列重叠 ≥ 50% → 按共享键横向 join,非全等列用 combine_first 合并;无公共结构 → 报错并建议分别分析(建议不超过 10 个文件)。
  2. LLM 数据转换(沙箱执行)与安全层 ------ 原始数据格式不匹配目标图表时,由 LLM 生成 pandas 代码,仅可用 df / pd / np,必须产出 result DataFrame;支持 pivot / melt / groupby / diff / ffill / rename 等长宽表重塑与聚合。沙箱强制校验:关键词黑名单 + AST 白名单 + 安全 builtins;禁用 import / open / exec / eval / os / sys / subprocess / 文件 IO / 网络;执行超时 10 秒,递归深度上限 500。违规返回带 violationsuggestion 的结构化错误,按提示改代码重试,无需用户确认。
  3. 26 种图表类型 + 3 套主题 ------ 覆盖 linebarareapiescatterradarheatmaptreemapgraphboxplotwaterfallgaugesankeyfunnelsunburstwordcloudhistogramstacked_barbubbleparetocombovennmindmaporgchartliquidspreadsheet 共 26 类;每类标注适用场景、触发关键词、y 轴基数与所需 DataFrame 形态,26 类全配 plot_stats 统计摘要。venn(交集行命名 A∩B)、mindmap / orgchart(父子分类列)、graph / sankey(source / target / value 自动识别)、combo(双轴)、spreadsheet(透视 / 明细表)等低频形态亦为一等公民。3 套主题:default(Okabe-Ito 色盲安全调色板)/ classic(ECharts 原生)/ dark。视觉契约(渲染层硬保证):bar / stacked_bar 在数据全非负时锁定 y 轴 min: 0(防截断夸大差异),area 恒零基线,line 仅显式 --y-scale 才放开;热力图按数据正负自动切换单色顺序渐变 / 双色发散渐变。
  4. 交互式 HTML 交付物 ------ 单文件自包含 HTML(ECharts JS 内嵌,离线可渲染);数据点超阈值(默认 15 个)自动启用 dataZoom(滑块 + 拖拽 + 横向滚动条 + 全屏);标题 contenteditable,浏览器内双击即可改名并同步导出图片文件名。多图批量模式(≥ 2 张图强制走 --charts / --charts-file):文件只解析一次、单进程生成全部图表,支持逐图独立 transform 与全局前置 transform;部分失败仍 exit 0,全失败才 exit 1;--charts-file 规避中文 / 引号的 shell 转义损坏;多文件可用 shell 后台并行。
  5. 交付解读规范(区别于普通画图工具的设计内核) ------ 强制「先算事实、再写解读」两步法:--dry-runplot_stats → LLM 据此写 2--4 句解读(图是什么 / 最显著事实带具体数值 / 口径说明)→ 带 --annotation 正式生成,注入 HTML 图表下方「图表说明」区块。硬边界:解读中每个数字必须在 plot_stats / data_preview 有出处,禁止凭印象编造;plot_stats.x_cardinality 须按 x 列语义表述(x 是姓名则写「59 名学生」而非「59 个类别」)。标题写结论、副标题补口径:--title 用主谓宾 + 数值(「营收同比增长 23%」),时间范围 / 筛选条件 / 来源放 --subtitle。校对口径直读 stdout 的 data_preview + data_rows(取自 transform 之后、渲染所用同一份数据,即被绘制内容的真值),不需要打开 HTML 搜数据。排版细节:--sort none|value--label auto|all|key--label-col(散点 / 气泡 / 箱线图身份列自动进 tooltip)、--color-by(默认关闭,无分析意义的着色视为视觉噪音)。
  6. 语言与错误契约 ------ 图表全部文案(标题、系列名、tooltip、按钮、页脚、HTML lang)单语言一致;默认从数据自动判定(表头与字符串单元格 CJK 占比 > 5% 判定为中文),不主动传 --lang。结构化错误体系:stdout / stderr 输出 {error, code, code_name, details.suggestion},共 15 个语义化错误码,按层分段(1001--1004 文件、2001--2003 解析、3001--3004 transform、4001--4003 图表、9999 未知);文件级错误走 stderr,图表级错误走 stdout。
  7. 内置工程化配套 ------ 开发者自查脚本 ux_regression_check.py:核查图表 UX 不变量(身份标签、颜色编码、tooltip、真瀑布图)与 v8 重构保证(共享统计内核、RenderContext、ID 列保护、合并 _dup 修复等);ChartGenerator 编程式 API:generate_chart() / generate_multi_charts(),失败返回 success: False + 结构化 error 字典而不抛异常。

触发条件

  • 触发通道 ------ frontmatter description(模型匹配依据),两条正向信号:(1) 用户提到「分析数据」「生成图表」「数据可视化」"chart""visualization",或提供数据文件要求分析 / 可视化;(2) 用户要求从表格数据生成图表或报告,即涉及 CSV / Excel / JSON 等表格数据文件的处理任务。
  • 内部路由(由 Agent 自主决策,不向用户确认) ------ 技能显式规定「生成图表是廉价可逆动作」(重生成 1--10 秒、零外部副作用):图表类型按选型表的 "Trigger Keywords → Required DataFrame Format" 映射数据形态(trend / 趋势 → line;占比 → pie;分布 → boxplot / histogram;流向 → sankey;80/20 → pareto......),不弹菜单;文件读取策略中 --skiprows / --header-row / --sheet 的 N 值须先无 flags 跑一次看原始布局再定,不得拍脑袋固定;多文件合并按列重叠率自动选纵向拼接 / 横向 join;取值口径按列名 / 单位 / 数值范围推断。
  • 事后审阅代替事前确认 ------ 交付语中显式列出本次关键假设(如「选了 line,因 month 是时间序列列」「多文件按列名完全相同走纵向拼接,已注入 source_file 列」「销量按金额口径」),用户不同意可一句话要求换口径 / 换类型 / 换合并方式重生成。
  • 唯一必须的用户介入点 ------ 同一环节失败重试 2 次后仍失败(Exit Criteria 的「仍失败」分支):须如实报告 code_name / suggestion / 已尝试的修复并等待用户决策,不得静默改用自写脚本兜底。

前置条件

pip install -r requirements.txt(Python 3.11+,4 个钉死版本依赖:pandas==3.0.1numpy==2.4.3openpyxl==3.1.5xlrd==2.0.1);无需网络,ECharts 已内嵌于 assets/

边界与约束

  • 必须走 CLI 工作流(data_parser.pycli.py),禁止自写脚本替代;
  • 列重命名 / 重塑 / 聚合必须用 --transform-code(解析层只解决「哪行是表头」,其余清洗归 transform);
  • 不支持场景(如嵌套 JSON 超过 1 层)必须先向用户说明并给建议,不得静默绕过;
  • 交付时必须附 LLM 写的文字解读并通过 --annotation 注入,不得只交付裸图;
  • 能力边界(明确声明不支持):数据库直连(需先导出 CSV)、实时 / 流式数据、地理地图、超过 100 MB 的文件(建议 ≤ 50 MB)、超过 1 层的嵌套 JSON、非表格数据(图片 / 音频 / 视频);自动合并要求列重叠 ≥ 50%。

标签

  • data-visualization:数据可视化,26 类 ECharts 图表
  • echarts-html:离线自包含交互式 HTML 交付物
  • tabular-data-insight:CSV / Excel / JSON 解析与数据洞察
  • llm-sandboxed-transform:LLM 生成 pandas 代码沙箱执行
  • agent-skill:Agent 技能包,无人值守自主决策交付

9. archify:把架构图当代码来「编译」

来源tt-a1i/archify(MIT 协议,当前开发版 v2.17.0-dev.1,基于 Cocoon-AI/architecture-diagram-generator 演化;GitHub 逾 5.9 万 star;项目主页 tt-a1i.github.io/archify 附有可交互的 Proof Lab 示例库)

archify 把「画图」变成了「编译」:Agent 只负责产出 Typed JSON IR(事实层),Archify 这个 Node.js 渲染与校验系统负责确定性校验 + 渲染(表达层),输出一张可探索、自包含的单文件 HTML 技术架构图。渲染过程不推断、不美化外部语义,也不编造拓扑------README 里有句话把定位说得很绝:"Archify is not a general-purpose drawing editor or a Mermaid theme. It turns technical intent into a communication artifact."(它不是通用绘图编辑器,也不是 Mermaid 皮肤;它把技术意图变成沟通制品。)

核心功能

  1. 五种图类型 + 类型路由 ------ architecture(组件、服务、云 / 安全边界、基础设施)、workflow(流程、审批门、工具调用、Runbook、CI/CD)、sequence(API 调用链、请求生命周期、异步链路与返回)、dataflow(管线、ETL/ELT、血缘、治理、下游消费)、lifecycle(状态迁移、重试、等待、终态)。每型有独立 JSON Schema(schemas/)与渲染器;类型歧义时用 archify guide "<场景>" 由 CLI 裁定。新增 workflow 走 schema_version: 2,仅保留既有固定几何时用 v1。
  2. 三种输入起步 ------ 纯语言描述即可出图,不需要绑定代码库;Mermaid 输入(flowchart / graph → workflow 或 architecture;sequenceDiagram → sequence;stateDiagram → lifecycle)只读取拓扑与语义,然后重新创写 Archify JSON,不做机械的 Mermaid 换肤;需要贴合真实代码时,Architecture 可挂仓库证据:节点显示 SRC n,可打开 Git 校验、钉死到公开 commit 的文件与行号(--repo-root),普通成品不携带源码信息。
  3. Typed JSON IR → 确定性编译为独立 HTML ------ 输出为内联 SVG 的单文件自包含 HTML(模板已内嵌,无托管运行时、无 CDN 依赖);四套视觉预设(classic 默认 / signal-flow / blueprint / editorial)× 深浅主题,主题切换不改变预设。
  4. 成品自带完整阅读器(非额外工作量) ------ 主题切换、平移缩放、搜索、聚焦、关系追踪、上游 / 下游可达范围、精确路径探查、语义角色对比(透镜)、全局雷达、引导故事(不超过 5 章)、演示舞台、稳定深链(#focus= / #route= / #lens= / #view=);快捷键 ? / R L M P F S T E。所有交互只复用作者定义的节点与关系,不把「图上可达」谎报为运行时影响。
  5. 导出与分享 ------ PNG / JPEG / WebP / SVG / WebM;以及 1200×630 的 Share Card 三形态:通用 Copy Share Card、Route Share Card(导出真实路径,保留完整拓扑上下文)、Reach Share Card(导出一次上游 / 下游阅读结果,且明确自称非运行时影响分析)。导出永远是完整原图,不携带临时 Viewer 状态。
  6. Architecture Delta(架构变更评审) ------ archify compare architecture base.json head.json → 校验过的 Before / Delta / After,准确区分新增、删除、语义变化、移动、重路由,并产出机器回执;全程只读,不推断影响、风险或合并安全性。
  7. 门禁式交付(本 SKILL 最硬的工程约束) ------ validate:必须 showcase 档案报满 9 项 artifact 检查、0 composition errors、0 warnings;只有 4 项检查属于基础校验,不算 showcase 验收。deliver:把规格字节冻结进同目录私有快照 → 渲染该校验快照 → 全部通过才原子替换目标文件,并回报 specificationartifact 的 SHA-256 与字节数;失败时保留上一份可信成品(此时不可跑 visual-check,那会测到陈旧产物)。visual-check:用 Chrome / Chromium(DevTools pipe)在 1440×900 / 1600×1000 / 1920×1080 / 2048×1320 实测容器约束,抓深浅两色截图与 JSON 回执,且永远只报 visualReview: "pending"。三种主张严格分离:确定性校验 ≠ 浏览器证据 ≠ 人工观感复核,互不蕴含。
  8. 失败即结构化修复,且有轮次上限 ------ validate --json / deliver --json 返回稳定规则码 + 准确 subject + 测量 evidence + supportedFixes;只改被诊断对象,不整图重写;连续两轮未刷新最优错误数即停止,如实上报未解决诊断。
  9. 反造假与反 AI 味的内置红线 ------ 禁止用 overflow: hidden、裁切内容、内层滚动条、拉伸 SVG 高度或缩小字号来伪造过检;每个检查尺寸须满足 scrollWidth ≤ innerWidthscrollHeight ≤ innerHeight。默认一条主路径、不超过 12 个主节点;subtitle / legend / engineering_profile 默认省略,不编造废话文案与装饰卡片。
  10. 边界与配套 ------ 不是通用绘图编辑器,也不是 Mermaid 主题器;无 shell 时降级为手工把 architecture SVG 放进 assets/template.html 并使用 CSS 语义类。仓库配 benchmarks/ 基准目录、依赖钉死(ajv / parse5 / saxes / simple-icons 仅作开发依赖,overrides 锁定 fast-uri@3.1.5)。

触发条件

  • 触发通道 ------ frontmatter description(模型匹配依据),三条正向信号:(1) 要出图:用户要求可视化系统架构、基础设施、云 / 安全 / 网络拓扑、技术工作流、API 调用序列、请求生命周期、数据管线 / ETL/ELT / 数据血缘、状态机,或要求把 Mermaid 转换 / 美化;(2) 要交付形态:明确要「可探索的独立 HTML 图表」「带深浅主题 / 可选轨迹动效」「可导出 PNG / JPEG / WebP / SVG / WebM」;(3) 要真实代码依据:图必须反映真实仓库,需要读仓库证据。

  • 内部路由(由 Agent 自主决策,不向用户确认) ------ 类型路由(歧义时靠 guide)、Mermaid 到五型的映射、布局由故事决定(层级 / 留白 / 线路),均不弹菜单。

  • 默认静默、显式才开的能力(本 SKILL 触发面最容易被忽略的一半):

    能力 默认 显式条件
    动效 meta.animation: "trace" 静态 用户要演示 / 汇报
    meta.visual_preset 省略 = classic 用户点名 signal-flow / blueprint / editorial
    meta.engineering_profile 省略 用户明确要生产部署拓扑 / 归属交接 / fail-closed 部署评审
    preview 实时预览 绝不默认启动 桌面创作循环显式调用
    --open 打开浏览器 关闭 用户要即时本地预览
    meta.subtitle / meta.legend 省略(legend 走 auto 用户明确要求
    品牌徽标 brand 省略 节点确指真实产品;无预设且用户给出官方 HTTP(S) URL 才 brands capture(digest 钉死的显式抓取)

前置条件

Node ≥ 18(包内免安装,node bin/archify.mjs doctor 自检);visual-check 需 Chrome / Chromium,缺失时以 exit 2 报 skipped(且运行 / 抓取失败不得被归为 skipped);渲染从不执行未钉死的品牌抓取;非 en / zh-CN 的创作语言必须主动声明 Viewer 固定 UI 与 <html lang> 回退英文。

边界与约束

低频附带行为:首个候选产出后会跑一次 scripts/check-update.mjs 发布检查------失败静默(不成功不提及),成功时最多显示一条可选更新提醒(security 级加限定警示标记),只提示、绝不下载或安装,用户显式确认后回执 --ack;可用 ARCHIFY_UPDATE_CHECK_DISABLED=1 完全关闭。请求仅访问固定的 stable manifest 地址,不发送本地版本、Agent、项目数据或用户输入。

标签

  • architecture-visualization:技术架构可视化,架构 / 工作流 / 时序 / 数据流 / 生命周期五型
  • json-ir-renderer:Typed JSON IR 确定性编译,渲染层不编造拓扑
  • self-contained-html:单文件自包含可交互 HTML + 内联 SVG,无托管运行时
  • deterministic-validation:门禁式校验、原子交付、SHA-256 回执、结构化修复
  • agent-skill:Agent 技能包,跨 Raven / Cursor / Claude Code / Codex / opencode 分发

第四章 向外求索:资讯、调研与浏览器

Agent 关在自己的沙箱里,知道的永远停留在训练截止那天。这一章的四个技能都在帮它「向外求索」,姿势却各不相同:ai-radar 每天读 AI 圈的公开信号,UniFuncs 两兄弟把「深度搜索」和「深度调研」做成可调用的云服务,agent-browser 则直接给它一双操作真实浏览器的手和眼。有意思的是成本哲学泾渭分明:ai-radar 零 API、零 Key,agent-browser 也只在本地驱动你自己的 Chrome,分文不取;UniFuncs 一对则按次计费,所以它们把「花钱之前先问你」写进了规矩。

10. ai-radar:永不变砖的 AI 日报员

来源LearnPrompt/ai-news-radar · skills/radar(安装:npx skills add LearnPrompt/ai-news-radar -s ai-radar -g

「AI 日报」类技能不少,但大多有个致命伤:依赖作者的服务器,服务一下线,技能就成砖。ai-radar 的设计绕开了这个问题------它是一个零 API、零 Key、零服务器的中文 AI 资讯查询技能,只做取数 + 路由 + 组稿:读取 AI News Radar 公开管道(150+ 信源、AI 相关性过滤、信源分层)每 30 分钟发布在 GitHub Pages 上的公开静态 JSON,将过去 24 小时的 AI 信号整理成一份带原文链接的中文简报。而整条数据管道可以 fork------上游真没了,你自己也能长出一模一样的数据。

核心功能

  1. 数据层 ------ BASE_URL=https://news.learnprompt.pro/data,一行可改指向自部署 Pages:

    文件 体积 用途
    daily-brief.json 约 60 KB 默认主入口:精选 20 条,自带 persona 点评
    latest-24h.json 约 2 MB 24h AI 全量条目,用于追问 / 按 ai_label / 关键词过滤
    top3-personas.json 约 4 KB 每日 TOP3 的三种口味并排点评
    stories-merged.json 约 1.4 MB 多源合并故事线(importance 分层)
    source-status.json 约 8 KB 各信源健康度、抓取量
    latest-24h-all.json 约 12 MB 含非 AI 全量,先提醒体积
    archive.json 约 56 MB 历史存档,默认禁止,需先征得同意
  2. 执行工作流(三步固定) ------ (1) 新鲜度检查(铁律第一步) :先读 generated_atdaily-brief 超 48 小时即降级到 latest-24h 并说明原因;latest-24h 超 36 小时照常回答但开头如实标注「数据停在 X 日」;绝不把过期数据当新鲜数据报。(2) 路由表择数据源 :宽问题(「今天 AI 圈有什么」)→ daily-brief;追问细节 → latest-24h 取头部更多;按类别 → 按 ai_label 过滤(model_release / ai_product_update / developer_tool / agent_workflow / research_paper 等 11 类);按公司 / 关键词 → 在 title / title_en / ai_signals 匹配;「毒舌 / 锐评 / 换口味」→ top3-personas;「今天的大事 / 故事线」→ stories-merged;「哪些源有料」→ source-status;问历史 → 说明 24 小时滚动窗口限制 + archive 体积警告。(3) 组稿输出 :铁律是大文件先下载到 /tmp 再用 python3 过滤,绝不整份 JSON 倒进上下文;产出按「模型发布 / 产品与工具 / 值得注意」分组的中文 Markdown 简报,默认 10--20 条、宁缺毋滥,每条必带原文 url 与信源名;官方一手源(source_tier_rank 0/1)优先,热议参考(rank 5)只做补充不混排;文末永远标注数据时间。

  3. 口味机制 ------ 每条可带 persona_id / persona_score(0--100)/ persona_review(不超过 40 字的中文点评),三种口味为 pragmatic 实用派(默认)/ cynic 毒舌评论员 / paper-police 较真党。上游未配 LLM Key 的降级模式下无 review 字段------自然跳过该行,不解释、不自己编。

  4. 失败模式处理 ------ Pages 404 / 网络失败 → 换 raw 地址重试一次,仍失败即如实告知、不编造新闻;某类别为空 → 如实说「过去 24 小时没有该类条目」,不拿别的凑数;超窗问题 → 说明限制并给 archive 选项。

  5. 生态分工与可 fork 性 ------ 与伯乐 Skill 分工为「ai-radar 管读,伯乐管选」:换信源 / 换口味需 fork 仓库、改 personas/ 下的 Markdown、再把 BASE_URL 指向自己的 Pages。核心差异化主张是数据管道可 fork:上游服务下线,fork 一份即可在自己的 Pages 上长出一模一样的数据,Skill 永不变砖。

触发条件

依据 SKILL.md frontmatter 的 description(即模型匹配依据)触发:

  • 「今天 AI 圈有什么」「AI 日报」「过去 24 小时 AI 新闻」「最近 AI 有啥」「AI 圈热点」;
  • 「最近有什么大模型发布」「AI 产品更新」「Agent 工具有什么新东西」「OpenAI / Anthropic / Google 最近发了什么」「Sora 相关」;
  • 「看下 AI 雷达」「哪些 AI 信源值得看」「锐评一下今天的 AI 新闻」「毒舌点评」「换个口味点评」;
  • 即使用户只说「AI 圈」「AI 新闻」「今天有什么新东西」,只要上下文属 AI / 大模型 / Agent / 开发者工具领域就应触发;description 明确要求不要 undertrigger------理由是训练数据里的「最新」必然过期,不调此 Skill 等于把过期数据当今日新闻,对用户有害。
  • 明确不触发 :维护 AI News Radar 仓库本身(加信源、改抓取逻辑、部署 Pages → 走仓库内的伯乐 Skill skills/ai-news-radar/);非 AI 的通用新闻查询;需要登录态的私有信息源。

边界与约束

安全边界:只发 GET、只读公开静态文件、不发写请求;不需要也不接受任何 API Key / token / cookie;不抓需登录页面;引用时保留原始链接、不改写来源归属。

标签

  • ai-news-briefing:中文 AI 资讯简报
  • zero-api:零 API、零 Key、零服务器
  • freshness-verification:新鲜度校验(铁律第一步)
  • multi-persona-review:多口味点评
  • forkable-data-pipeline:可 fork 的数据管道

11. unifuncs-deep-search:多源交叉验证的「深搜」

来源UniFuncs/skills · unifuncs-deep-search(UniFuncs 官方技能仓库,MIT 协议,Python,2026 年 1 月创建;同仓库还有 unifuncs-search、unifuncs-reader 两个轻量技能,并提供托管 MCP server)

前面十个技能几乎都是「本地优先」的信徒,这一对兄弟却是相反的路线:技能本身不含任何数据,而是商业 API 的「说明书 + 客户端封装」------Agent 读完 SKILL.md,学会的是如何正确调用 UniFuncs 的云端深度搜索服务。作为轻重组合中的轻量级,deep-search 负责快速、全面地摸清一个主题:多轮搜索与阅读、多源交叉验证,产出一份完整的搜索报告,全程约 1--5 分钟。

核心功能

  1. 深度搜索报告 ------ 面向特定主题执行多轮搜索与阅读,产出完整搜索报告;仓库 README 强调其「多源反幻觉交叉验证」(anti-hallucination cross-verification)。适用于比标准网页搜索更深、更广、更完整的取证需求,或多部分复合问题的汇总回答。
  2. 三个独立入口脚本 ------ deep-search-report.py(同步取报告,需给足超时,默认上限 900 秒);deep-search-create-task.py(异步创建任务、返回 task_id,须留存 ID 供后续查询,避免重复建任务);deep-search-query-task.py(按任务 ID 查状态与结果)。
  3. 可调研参 ------ --model s1/s2/s3/s3-pro(默认 s3,s1/s2 已弃用)、--language zh/en--reference-style link/character/hidden(引用标注风格)、--max-depth(最大调研深度)、--domain-scope / --domain-blacklist(域名白名单 / 黑名单)、--important-urls / --important-keywords / --important-prompt(重点线索注入)、--introduction(研究员角色与口吻)、--stream-file / --read-stream-file(流式内容落盘与断点续读)、--push-to-share / --set-public(推送分享空间)。
  4. 成本意识设计 ------ SKILL.md 自述这是「相对昂贵的操作」:用户未明确要求 deep search 时须先确认再跑;意图模糊时只做简短澄清、不过度盘问,指令一明确立即执行。

触发条件

  • frontmatter description 触发:用户要求 deep search、广泛调查(broad investigation)或某主题的深度覆盖时命中;仓库 README 给出的触发关键词还包括 fact verification。argument-hint: [query]allowed-tools 仅放行 Bash(python3:*)

前置条件

需先在 unifuncs.com/account 申请 API Key 并 export UNIFUNCS_API_KEY;配套生态:同仓库的 unifuncs-search(网页实时检索)、unifuncs-reader(读取网页 / PDF / Word / Excel / PPTX),以及 MCP server(mcp.unifuncs.com,Streamable HTTP 与 SSE 双端点)。

标签

  • deep-search:深度搜索与多源交叉验证
  • api-backed-skill:商业 API 的客户端型技能
  • sync-async-task:同步报告 + 异步任务双模式
  • cost-aware-confirmation:昂贵操作先确认
  • fact-verification:事实核验取向

12. unifuncs-deep-research:把调研写成万字报告

来源UniFuncs/skills · unifuncs-deep-research(与 deep-search 同仓库、同账号体系)

如果说 deep-search 是「把资料找全」,deep-research 就是「把报告写完」------它在深搜之上叠加 AI 推理与分析,产出 10,000 字起步的长篇报告,耗时约 3--10 分钟。而它最醒目的设计不是产出本身,而是一道「强制二次确认」闸门。

核心功能

  1. 深度调研与长篇报告 ------ 定位 report-style 产出而非搜索报告;若用户并未明确要求深度调研,SKILL.md 直接建议改用更轻的 unifuncs-deep-search(并附跳转链接)。
  2. 强制二次确认(Mandatory second confirmation) ------ 运行任何脚本前,必须先概述三件事、等用户在同一会话中明确同意(「确认 / 可以 / yes」)后才许执行:(1) 将发送的调研主题;(2) 任务耗时长(约 3--10 分钟)且成本高于 deep search;(3) 计划使用的非默认选项(如 output-typemodel)。用户若调整主题或选项,确认流程重来一遍;概述后意图仍有歧义,则先补一个简短澄清问题。
  3. 三入口脚本同构 ------ deep-research-report.py(同步,超时默认 1800 秒,默认流式,--no-stream 关闭)/ deep-research-create-task.py / deep-research-query-task.py;另有 --plan-approval:执行前先生成研究计划、等批准------第二道人因闸门。
  4. 八种输出类型 ------ report(默认长篇报告)、summary(摘要),外加六种中文内容平台体裁:公众号文章、小红书笔记、头条文章、知乎文章、知乎回答、微博文章;--output-length 默认 10000 字。模型 --model u1/u1-pro/u2/u3/u3-pro(默认 u3,u1/u2 已弃用)。

触发条件

  • frontmatter description 触发:用户要求 deep research、研究报告(research report)或综合分析(comprehensive analysis)时命中;要的是「报告式产出」而非「搜索结果」。

前置条件

与 deep-search 共用 UNIFUNCS_API_KEY

标签

  • deep-research:深度调研
  • long-form-report:万字长报告生成
  • mandatory-confirmation:强制二次确认闸门
  • chinese-content-platforms:公众号 / 小红书 / 知乎等平台体裁输出
  • plan-approval:先出计划、批准再执行

13. agent-browser:Agent 的手和眼

来源vercel-labs/agent-browser(Vercel Labs 出品,Rust 实现)

网页是为人眼设计的,Agent 想在上面干活,需要一双专门的手。agent-browser 是 Vercel Labs 给出的答案:面向 AI Agent 的浏览器自动化 CLI------Rust 原生实现(非 Node.js 包装层),通过 CDP 直接驱动 Chrome / Chromium,不依赖 Playwright / Puppeteer。定位是「让 Agent 像人一样操作真实浏览器」,而非给人类用的测试框架。

它有一个很妙的反熵设计:安装到 Agent 的 SKILL.md 只是发现存根(discovery stub),真正的使用指南由 CLI 按已安装版本现场下发(agent-browser skills get core),使指导内容永不与版本脱节;存根本身跨版本不可变,仅负责指向 skills get core

核心功能

能力覆盖九类:

  1. 页面读取与快照 ------ 核心循环为 open → snapshot -i → click @eN → 重新快照;用无障碍树(accessibility tree)快照 + 紧凑 @eN 元素引用表达页面,把交互上下文压到约 200--400 token,替代解析原始 HTML;引用在页面变化后即失效,必须重取。另有 read [url] 走 Markdown 内容协商(Accept: text/markdown、失败时追加 .md、沿祖先路径找最近 llms.txt),不启动 Chrome 即可取文档。
  2. 元素交互 ------ click / dblclick / fill / type / press / hover / select / check / scroll / drag / upload / clipboard / 鼠标控制;三种定位方式并存:@eN 引用、CSS 选择器、语义定位器(find role|text|label|placeholder|alt|title|testid)。
  3. 数据提取 ------ get text|html|value|attr|title|url|count|box|styleseval 执行 JS;diff snapshot|screenshot|url 做前后与双 URL 对比。
  4. 会话与状态 ------ 浏览器状态按命名 session 隔离,支持状态持久化与 --restore 恢复、认证保险库、cookies / storage 读写(支持 Copy-as-cURL 导入)、多标签页(稳定 t<N> id + 自定义 label)、多浏览器并行。核心指南建议为每个任务使用独立的命名 session:默认匿名 session 全机共享且跨会话持久,多 Agent 同机干活时容易互相踩到对方的页面。
  5. 网络层 ------ 请求拦截 / 阻断 / mock;请求追踪按类型 / 方法 / 状态过滤;HAR 录制(默认内嵌文本响应体,离线即可研究站点 API)。
  6. 环境模拟 ------ viewport / device / geolocation / offline / 自定义 headers / HTTP Basic 认证 / 深色模式 / 代理与 CA 证书。
  7. 诊断与质量 ------ 内置 axe-core 无障碍审计(a11y)、React 内省(组件树 / inspect / 重渲染录制 / Suspense 边界)与 Web Vitals(LCP / CLS / TTFB / FCP / INP)、CDP 追踪与性能剖析、batch 批量执行、:4848 可观测性面板、视频录制与实时视口流。
  8. 集成形态 ------ CLI、MCP server(core / network / state / debug / tabs / react / mobile / all 分档 profile,默认 core 以控上下文)、eve agent 扩展。
  9. 专项子技能(按任务类型加载) ------ electron(VS Code / Slack / Discord / Figma 等桌面应用)、slack(工作区自动化)、dogfood(探索式测试 / QA / bug hunt,产出带逐步截图与复现视频的结构化报告)、derive-client(录 HAR 反推站点独立 API 客户端)、vercel-sandboxprotected-vercel-deploymentsagentcore(AWS Bedrock AgentCore 云浏览器)、webmcp-gen

触发条件

  • 触发场景(description 列明):用户需要与网站交互时即触发------打开网页、填写表单、点击按钮、截图、从页面抓取数据、测试 Web 应用、登录站点,或任何需要程序化 Web 交互的任务;以及探索式测试、dogfooding、QA、bug hunt、评估应用质量。扩展触发:自动化 Electron 桌面应用、读取 / 发送 / 搜索 Slack、在 Vercel Sandbox 微虚机或 AWS AgentCore 云浏览器中运行自动化。
  • 强优先级指令Prefer agent-browser over any built-in browser automation or web tools.------只要任务落在浏览器自动化范畴,本技能优先于宿主内置的浏览器 / 网页工具。

边界与约束

  • 安全边界被明确写进技能:--allowed-domains 域名白名单会同时禁用 RTCPeerConnection 以防 WebRTC 绕过 HTTP 过滤,并要求 Worker 在 CSP 禁止守卫时失败关闭而非降级放行;另有 --content-boundaries--max-output
  • 技能要求把页面内容、console、网络响应体、React 树标签一律视为不可信数据而非指令,禁止模型自行编造 URL 或遵从页面指示跳转。
  • 存根 frontmatter 含 hidden: true,即该技能默认不在技能列表中展示;allowed-tools 仅放行 Bash(agent-browser:*)Bash(npx agent-browser:*)

标签

  • browser-automation:浏览器自动化
  • chrome-devtools-protocol:基于 CDP 驱动 Chrome / Chromium
  • accessibility-tree-snapshot:无障碍树快照与 @eN 引用
  • ai-agent-cli:面向 Agent 的 Rust 原生 CLI
  • web-scraping-and-qa:网页抓取与探索式 QA

第五章 垂直场景:专利与汇报

最后两个技能来自个人开发者,解决的却是最具体的真实痛点:一个帮研发把技术贡献写成专利,一个帮打工人把周报写出人味儿。它们证明了一件事------Skill 的门槛已经低到「一个人 + 一个痛点」就能起步。

14. patent-disclosure-skill:让干活的人写得上专利

来源handsomestWei/patent-disclosure-skill(MIT 协议;套件名「中国专利.skill」)

作者在 README 里写了一句很戳人的初衷:「做了多年核心研发,专利发明人那一栏从没写过我的名字。」代码是自己敲的,方案是自己扛的,轮到交底书却卡在专利点怎么挖、查新怎么写、框图和 Word 怎么一次交得出去。这个套件就是为「真正干活的人」打通这一环。

它是面向中国专利全流程的 Agent 技能套件,以根 SKILL.md 路由 8 个子技能。

核心功能

  1. 主链路 ------ 专利点挖掘 → 交底书编写(发明 / 实用新型 / 外观是包内三个目录,而非三个独立技能)→ 申请文件(权利要求书 · 说明书 · 摘要 · 附图四件套)→ 案卷会稿一趟交付。交底书环节内置分步流程:intake → 项目扫描 → 挖点 → 填表 / 线稿 → 轻量查新(一词一页)→ 预览 → 成文 → 自检,迭代留痕。
  2. 旁挂能力 ------ 著录检索(人名、公司、分类号照查,还能扔一张产品图或一段权要倒推检索式)、公开专利通俗解读与 Obsidian 知识库入库(双链 + 图谱,沉淀私有专利情报层)、专利地图(语义地形 / 申请人四象限 / 同族引证 / 技术功效矩阵 / 仪表盘)、审查意见答复辅助(从业经验与实务书技巧蒸馏进库,RAG 检索增强)与审查政策简报(对照国知局近期政策,提示哪些交底技巧可能过时)。
  3. 配套工具链 ------ Mermaid / CAD 出图、外观与实用新型线稿生成、Markdown → Word 公式可编辑等。
  4. 案卷会稿的角色扮演 ------ patent-docket 让 Agent 分饰交底工程师与专利代理师,自主多轮规划工作流,清单最多对打三轮,缺事实就问、绝不瞎编

触发条件

  • 交底书、读专利、著录检索可按意图自动进入;
  • 申请文件、案卷、专利地图、审查答复、政策简报均须用户显式点名且满足前置条件(指定交底目录、已装依赖等);
  • 两条硬性边界写在交底书技能里:著录检索独立成包,禁止 把交底包内的轻量查新工具当著录检索引擎调用;交底交付后不要自动进入申请文件,用户点名并给出目录后才继续。

标签

  • china-patent:中国专利
  • patent-drafting:专利交底书与申请文件
  • patent-search-and-interpretation:专利检索与解读
  • agent-skill:Agent 技能套件(8 个子技能)
  • ip-knowledge-base:知识产权知识库

15. work-report-pro:把周报写出人味儿

来源腾讯 SkillHub · yjkj-work-report-pro(v1.0.0;作者是一位 WorkBuddy 用户,因「重复活儿干烦了」而封装,同期作品还有 agnes-image-gen 与 yuque-connector)

每个周五下午,总有人在工位上对着空白文档发呆:这周明明忙得要死,写出来却像没干活。work-report-pro 的思路是反着来------你只管甩关键词和口水话,它负责成稿,并且立下军规:不许有 AI 味。

核心功能

关键词 / 口水话直出的工作汇报生成 Skill:覆盖日报、周报、月报、年报四层汇报,产物落盘为本地 Markdown 归档。

  1. 四层递进式汇报体系 ------ 日报(每日记录)→ 周报(汇总本周日报)→ 月报(汇总本月周报)→ 年报(汇总本年所有月报)。每层生成前静默读取上一层的历史文件作为补充素材,形成连贯、可持续叠加的汇报链------周报自动读日报、月报自动读周报,不用重复写。
  2. 产物即本地 Markdown 归档 ------ 落盘于 {workspace}/.workbuddy/reports/,四类子目录 daily/2026-06-05.md)、weekly/2026-W23.md)、monthly/2026-06.md)、annual/2026.md),因此下一层汇总有据可依;保存动作由 mkdir -p + heredoc 的 shell 命令完成。
  3. 关键词 / 口水话直出(核心能力) ------ 用户只需扔几个词或一段碎碎念(「登录bug、数据导出、3个线上bug」/「今天登录那块终于搞完了,卡了两天」)即可成稿;内置「关键词 → 自然短句」转换规则表,禁止审讯式提问(不得问「本周完成了哪些工作 / 遇到什么问题 / 下周计划」),只做最小询问;未提及的内容留空或写「无」,禁止编造数据。
  4. 强制去 AI 味规范 ------ 硬性禁用清单(「首先...其次...最后...」「总之 / 综上所述」「值得注意的是」「通过...使...」「随着...」、连续「了」字句、每句皆为完整书面句、Emoji 滥用即每 500 字最多 1 个且仅限标题);要求白话转折(「但 / 其实 / 倒是」)、口语断句、数字直写、问题写真实感受而非「有待提升」。生成后执行四问自检(像不像作文 / 有没有三个「了」字句 / 有没有首先其次 / 像不像真人周报),不达标即重写。
  5. 分档字数控制 ------ 日报 150--300(可调 100--500)、周报 400--800(可调 300--1200)、月报 800--1500(可调 500--2000)、年报 1500--3000(可调 1000--4000);用户指定则严格遵守,超则删减、不足则丰富但不注水。
  6. 先审后存 ------ 生成内容先展示并问一句「要不要改点啥?」,用户确认后才写盘;历史读取失败必须告知而非静默跳过。
  7. 已声明但未实现的扩展方向 ------ 接入 Git commit 自动提取素材、对接 TAPD / 飞书项目管理器、导出 PDF 或直发企微 / 钉钉、英文汇报多语言。

触发条件

  • 触发语义 :由 SKILL.md frontmatter 的 description 驱动,宿主 Agent(Claude Code / WorkBuddy 等兼容客户端)按语义自动匹配,无需用户指名技能;always: false,非每轮强制加载。
  • 显式触发词日报周报月报年报工作汇报工作总结年终总结;「写个日报 / 写周报 / 帮我汇总下这周 / 6月总结」等指令式表述均命中。
  • 隐式触发(无指令):任意含时间粒度的口语输入------「今天搞了...」「这周主要...」「今天:登录搞定,导出上线,修3个bug」;完全无明确指令时默认按「日报(今日)」处理,成稿后再询问确认。
  • 类型判定规则:含「周」→ 周报,含月份 / 「总结」→ 月报,含「年终」→ 年报,其余 → 日报;用户没给内容且历史为空时,仅允许问一句「这周搞了啥?随便说几个词就行」。

前置条件

无外部依赖(requires.bins: []requires_api_key: false);需工作区可写以创建 .workbuddy/reports/;周报 / 月报 / 年报的叠加效果依赖此前已存盘的上一层文件,无历史则退化为单次生成。

边界与约束

风险边界(官方提示):技能会读取并复用 .workbuddy/reports/ 下的历史文件,并可能将其内容带入更高层汇报,机密信息不应存放于该目录(除非已排除提交、同步与共享);SkillHub 页面显示其安全审核结论为「安全」。

标签

  • work-report-generation:工作汇报生成
  • hierarchical-rollup:日报 → 周报 → 月报 → 年报层层叠加
  • de-ai-tone:强制去 AI 味 / 口语白话
  • keyword-to-text:关键词 / 口水话直出
  • markdown-file-archive.workbuddy/reports/ 本地 Markdown 归档

结语:十五个技能教给我们的事

把这 15 个 SKILL.md 摊开对比,会发现它们在做同一件事:把「老师傅的经验」固化成 Agent 真正能执行的 SOP。而它们的共性选择,大致勾勒出了这个生态的设计哲学:

  1. description 是命门。触发全靠这一句,于是 skill-creator 为它专门造了一条「20 条拟真 query + train/test 切分」的优化流水线 ------ 在 Skill 的世界里,写好一句话就是写好一个入口。
  2. 上下文是稀缺资源 。渐进式披露无处不在:存根(agent-browser)、按需加载(OfficeCLI 的 load_skill)、三级资源分层(skill-creator)、大文件先落盘再过滤(ai-radar)。
  3. 确定性优先,不弹菜单。ppt-master 明文禁止路线选择菜单、archify 用 CLI 裁定图型、smart-charts 自主决策后交付假设 ------ 成熟的技能把「问用户」压缩到最少,把「可逆的事先做了」作为默认。而「确认」被留给真正昂贵的事:unifuncs-deep-research 要求概述主题、成本与选项之后,等一句「确认」才许运行。可逆的别问,花钱的必问。
  4. 诚实是硬约束,不是风格。ai-radar 数据过期必须直说;archify 把「确定性校验 ≠ 浏览器证据 ≠ 人工观感」三种主张严格分离;smart-charts 要求解读里的每个数字都有出处;patent 套件「缺事实就问、绝不瞎编」;unifuncs-deep-search 则把多源交叉验证当作防幻觉的工程手段。这些条款都在防止同一件事:Agent 一本正经地编造。
  5. 本地优先是主流,但不是唯一解。anydoc 纯 Rust 离线、smart-charts 零网络依赖、ppt-master 除模型通信外数据不出机;UniFuncs 两兄弟则反其道而行 ------ 技能本体只是商业 API 的说明书与客户端,能力全在云端。两条路线在同一个生态里相安无事,也说明 Skill 这层封装足够薄:包得住本地脚本,也包得住云服务。
  6. 可分发、可 fork、可退出npx skills add 统一了安装姿势;ai-radar 把「服务下线也能活」做成核心卖点 ------ 好的 Skill 不绑架用户。

如果说 MCP 解决的是「Agent 能连什么系统」,Skill 解决的就是「Agent 懂不懂这行的规矩」。前者接水管,后者传手艺。而这十五个标本共同指向的趋势是:手艺正在变得越来越便宜------便宜到一个人、一个痛点、一个周末,就能给全世界的 Agent 上一课。

相关推荐
Rocky Ding*1 天前
一文读懂LLM Agent Skills 的运行时本质:从能力路由到渐进式披露
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·agent skills
码哥字节4 天前
Claude Code 8问,最狠难题怎么破
mcp·claude code·agent skills
打破砂锅问到底0075 天前
端侧 Agent:手机本地多 Agent 协作
人工智能·ai·ai工程化·agent skills
AIGC大时代8 天前
Claude 科研栈拆解:Connectors 给文献视力,Skills 把 SOP 变成可调用流程
claude·学术写作·mcp·agent skills·科研工作流
guangzan1 个月前
Monorail:对齐 → 规格化 → 切片 → 构建
agent skills·local-first
deepseek231 个月前
MCP 负责“能做什么”,Agent Skills 负责“应该怎么做”:2026 年 Agent 架构的分层革命
ai agent·mcp·agent skills
码哥字节1 个月前
被Skill/MCP/Hook搞晕三周,我画了张决策图
claude code·agent skills
CodexDave2 个月前
没有Codex,也能使用Agent Skills完成仓库体检
node.js·agent skills·仓库体检·工程评测