用 WorkBuddy 调混元 Hy3 做批量文档摘要:一个可运行的实战示例

文档堆积如山,人工摘要又慢又漏。

上周有个客户把 30 多份项目周报、会议纪要和合同扫描件丢进群里,说"帮忙理一下这周到底发生了什么"。我盯着那堆文件,算了笔账:一份平均 8 页,逐篇 reading + 提炼要点,保守也要大半天,而且人一疲惫就容易漏掉关键结论。这种活儿交给大模型的"长上下文 + 结构化输出"来做,反而更稳。

这篇文章不讲概念,直接给一条能跑通的路:用 WorkBuddy 的工作流能力,或者干脆一段 Python 脚本,调用腾讯混元 Hy3(经腾讯云 TokenHub 接入)批量把本地文档压成结构化摘要。

为什么是 Hy3?它这一代是 295B 参数的 MoE 架构,单次推理只激活约 21B 参数,配合 256K 长上下文,一份长文档基本能一次喂进去,不用先切片再拼回。公开数据里提到,它在办公类任务上的成功率从 72% 提到了 90% 区间,平均耗时下降约 34%------对"批量处理一堆文档"这种场景,省下的就是实打实的等待时间。它上线后一周,在 OpenRouter 上的调用量较上一代增长逾 68 倍,也算侧面说明开发者愿意拿它干活。

思路其实很朴素:

  1. 把待处理文档放到一个文件夹,统一格式(这里用 .txt 示意,真实场景可先 OCR / 转写)。
  2. 逐个调 Hy3 的对话接口,要求它返回固定结构的 JSON(主题、核心结论、待办事项)。
  3. 把结果汇总写回一个文件,方便后续检索或贴进汇报。

下面这段脚本可直接复用。Endpoint 和密钥用占位符,真实接入时去腾讯云 TokenHub 拿分配好的地址与 key,写进环境变量,不要硬编码

复制代码
import os
import glob
import json
import openai  # 通用 openai-compatible SDK,实际接口字段以官方文档为准

# Hy3 关键特性(来自公开资料,具体以官方文档为准):
#   - 295B 总参数 MoE 架构,单次推理仅激活约 21B 参数,推理更省
#   - 支持 256K 长上下文,适合一次性喂入长文档做摘要
#   - 办公类任务成功率有较明显提升,平均耗时下降
#
# 接入方式:经腾讯云 TokenHub 分配 endpoint 与 key
# 下面 endpoint 用 example.com 占位,切勿写入真实密钥

client = openai.OpenAI(
    api_key=os.environ.get("HY3_API_KEY", "sk-xxxx-placeholder"),
    base_url="https://api.example.com/v1",  # 占位 endpoint,以官方文档为准
)

def summarize_one(text, max_tokens=512):
    """对单篇文档调用 Hy3 对话接口,返回结构化摘要。"""
    system_prompt = (
        "你是一个文档摘要助手。请阅读以下文档,"
        "严格输出 JSON:"
        "{\"主题\": string, \"核心结论\": string, \"待办事项\": [string]}"
    )
    # 256K 上下文足够长,这里留一点余量截断,避免极端情况下超限
    resp = client.chat.completions.create(
        model="hunyuan-hy3",  # 模型名以官方文档为准
        messages=[
            {"role": "system", "content": system_prompt},
            {"role": "user", "content": text[:200000]},
        ],
        temperature=0.3,
        response_format={"type": "json_object"},
    )
    return resp.choices[0].message.content

def batch_summarize(folder):
    """读取本地多份文档并批量摘要,结果汇总写回 summary.json。"""
    results = {}
    # ① 读取本地多份文档
    for path in glob.glob(os.path.join(folder, "*.txt")):
        with open(path, "r", encoding="utf-8") as f:
            content = f.read()
        # ② 调用 Hy3 对话接口做摘要
        summary = summarize_one(content)
        results[os.path.basename(path)] = summary
        print(f"已摘要: {path}")
    # ③ 输出结构化摘要并写回文件
    out_path = os.path.join(folder, "summary.json")
    with open(out_path, "w", encoding="utf-8") as f:
        json.dump(results, f, ensure_ascii=False, indent=2)
    print(f"全部完成,结果已写入: {out_path}")

if __name__ == "__main__":
    batch_summarize("./docs")

几个落地的注意点:

  • 文档格式不统一时,先用脚本做一层归一化(PDF/Word 转文本),再进摘要流程,失败率会低很多。
  • temperature 设低一点(0.3 左右),让输出更稳定、便于后续程序解析。
  • JSON 解析失败时加一层重试,别让单篇报错中断整批任务。
  • 如果文档特别多,可以借助 WorkBuddy 的定时/批量触发能力把这套脚本包成可复用工作流,不必每次手跑。

回到开头的那个群聊场景:跑完脚本,把 summary.json 里每篇的"核心结论 + 待办事项"贴进群,半小时就能给客户一份清楚的全貌。人工的价值从"逐篇读"转到了"核对与决策",这比硬扛文档堆要舒服得多。

混元 Hy3 这类模型现在可通过 WorkBuddy、腾讯云 TokenHub 等方式接入,当前也有相关的限时体验活动,具体以官方页面为准。

官方文档指引

  • 腾讯混元 Hy3 与 TokenHub 接入说明:详见腾讯云官方文档 cloud.tencent.com
  • WorkBuddy 工作流与集成能力:详见官方文档 workbuddy.cn
  • 腾讯云 ADP(智能体开发平台):详见官方文档 adp.tencent.com

公司简介

上海华万,专注为企业提供SaaS产品的一站式选型与集成服务。国内产品线涵盖腾讯会议、企业微信、腾讯电子签等腾讯生态产品,国际产品线包括Microsoft Teams、Zoom、DocuSign等协作与签约工具。从需求诊断、产品选型到系统部署、API集成与长期运维,华万为企业量身定制落地路径,覆盖售前咨询、方案设计、部署实施与售后服务全流程。目前已服务制造、零售、教育、金融等多个行业的中小企业客户。

相关推荐
梦想的旅途21 小时前
企微私域 AI 创作:文案生成与 AI 配图自动化发布实战
人工智能·自动化·企业微信
Bruce_Liuxiaowei1 小时前
多模态AI在网络安全监控中的创新应用
人工智能·安全·web安全
java修仙传1 小时前
从网页禅道到 AI 能调用的工具:我的禅道 MCP 实现思路分享
java·人工智能·python·ai应用·mcp开发
乌恩大侠1 小时前
图解 AI-RAN开发需要哪些软硬件:O-RU、DGX Spark、Sionna与Aerial
人工智能·spark·o-ru·ai-ran
中电金信1 小时前
中电金信 :一站式企业智能体柔性生产全链路解决方案
大数据·人工智能
观远数据1 小时前
跨部门BI落地的核心:如何做好数据集权限治理消除数据孤岛
大数据·人工智能
INNOVIX稳石机器人1 小时前
稳石AI智慧仓储解决方案:软硬一体,四维赋能, 重构智造仓储新范式
人工智能
微三云 - 廖会灵 (私域系统开发)1 小时前
人工智能在电商领域的全场景落地:从智能推荐到信任电商的技术重构摘要
人工智能·重构