神奇工具!把网页转换为markdown

你知道吗?有一种工具叫做Reader,它能够帮你把任何网址转换成更适合大型语言模型(LLM)处理的输入格式。就像给网页穿上了一件"智能外衣",让它们更容易被理解和使用。而且,这个服务完全免费哦!

今天就给大家详细介绍下如何使用这款工具。

如何使用

使用Reader非常简单,你只需要在任何网址前加上一个简单的前缀 https://r.jina.ai/ 就可以了。比如,如果你想把 https://en.wikipedia.org/wiki/Artificial_intelligence 转换成一个更适合语言模型处理的输入,你只需要访问:

r.jina.ai/https://en....

而且,Reader还有一个实时演示,你可以亲自去体验一下:

更新日志

Reader最近还增加了一个新功能,那就是支持图像阅读。它能够为指定URL中的所有图像添加标题,并在图片缺少alt标签的情况下,添加 Image [idx]: [caption] 作为替代。这样,下游的语言模型就能在推理、总结等过程中与图片进行交互了。你可以在这里看到一个示例:点击查看示例

安装指南

如果你想自己运行这个项目,你需要准备以下工具:

  • Node v18(注意:Node版本不能超过18,否则构建可能会失败)
  • Firebase CLI(通过 npm install -g firebase-tools 安装)

对于后端,你需要进入 backend/functions 目录并安装npm依赖:

sh 复制代码
git clone git@github.com:jina-ai/reader.git
cd backend/functions
npm install

模式选择

Reader提供了几种不同的模式,以适应不同的使用场景:

  1. 标准模式 :直接在URL前加上 https://r.jina.ai/ 即可。这种方式简单直接,适用于大多数情况。

  2. 流式模式:如果你发现标准模式下的结果不够完整,可以尝试流式模式。它会等待页面完全渲染后再提供内容。你可以通过设置请求头来启用流式模式:

    sh 复制代码
    curl -H "Accept: text/event-stream" <https://r.jina.ai/https://en.m.wikipedia.org/wiki/Main_Page>

    这种方式下,数据会以流的形式分块传输,每个后续块都包含更完整的信息。最后一个块通常提供最完整和最终的结果。这对于需要即时内容交付或希望以块处理数据以交错输入/输出和模型处理时间的下游系统非常有用。

  3. JSON模式 :虽然目前这个模式还处于早期阶段,输出的JSON并不是特别"有用",但它提供了 urltitlecontent 三个字段。你可以通过设置请求头来控制输出格式:

    sh 复制代码
    curl -H "Accept: application/json" <https://r.jina.ai/https://en.m.wikipedia.org/wiki/Main_Page>

总结

这个工具对于希望提高语言模型输入质量的开发者来说非常有用,尤其是需要处理网页内容的场景。通过Reader,可以更轻松地将网页内容转换为适合语言模型处理的格式,从而提升模型的性能和输出结果的质量。

相关推荐
钓了猫的鱼儿1 小时前
基于深度学习+AI的城市人行道障碍物目标检测与预警系统(Python源码+数据集+UI可视化界面+YOLOv11训练结果)
人工智能·深度学习·目标检测
HackTorjan6 小时前
2026年5月29日:全球首个通用人工智能操作系统正式发布,开启人机协同新纪元
人工智能
刘大猫.6 小时前
智造短剧新引擎:火山引擎上线「火山剧创 1.0」,制作效率提升 80%
人工智能·ai·chatgpt·机器人·大模型·火山引擎·短剧新引擎
红尘散仙7 小时前
我把终端小说阅读器接上了 AI Agent:TRNovel 现在能用 skill 生成书源了
人工智能·后端·rust
雅菲奥朗7 小时前
企业级 AI 自动化|OpenClaw 龙虾实战与认证
运维·人工智能·自动化·openclaw
HIT_Weston7 小时前
99、【Agent】【OpenCode】task 工具提示词(Slash command)(一)
人工智能·agent·opencode
25 Hz7 小时前
Mind 爱好者时空表征刊 第24期 | 时间结构学习、空间对时间表征的补偿、事件内部的时间扭曲……
人工智能
心中有国也有家7 小时前
GE图引擎深度解析——CANN的计算图优化与执行引擎
人工智能·pytorch·python·学习·numpy
海兰7 小时前
【文字三国志:第一篇】天命重构,大语言模型(LLM)动态生成文言风格的叙事文本的文字游戏
人工智能·游戏·语言模型
cxr8288 小时前
高分子复合材料 AI 逆向设计合——验证闭环、决策优化与中试放大
人工智能·材料逆向设计合成