技术栈
评测
Sherotree
8 天前
ai
·
agent
·
评测
·
系列
Agent 工程笔记③:为什么要有评测集(比单次演示重要)
评测集(eval set)是一组固定的任务与验收标准,用来反复测量 Agent 或提示策略是否变好、变坏。
deepseek23
13 天前
大模型
·
ai agent
·
评测
ARC-AGI-3 评测 harness 效应拆解:GPT-6 Astra 的 99.9% 与 62.7% 之间,隔着一整套测量装置
2026 年 9 月 3 日,OpenAI 发布旗舰模型 GPT-6 Astra。训练动用德州 Stargate 基地超过十万张 GPU,是该公司史上规模最大的预训练。总裁 Greg Brockman 在发布会上喊出「欢迎来到 AGI 时代」。同一份发布材料里,ARC-AGI-3 出现了两个相差悬殊的数字:99.9% 与 62.7%。两个分数指向同一个模型,同一天公布,却差了三十七个多百分点,几乎是及格线级别的鸿沟,业界一片哗然。
AIGC大时代
14 天前
aigc
·
论文
·
ai写作
·
评测
·
千笔-aiwritepaper
评 AI 论文工具的 6 个可复核指标:文献能否打开、大纲能否拖拽、检测是否限次…(千笔-AIWritePaper)
AI写作论文评测AIGC千笔-AIWritePaperAI写作论文评测AIGC千笔-AIWritePaper
AIGC大时代
14 天前
llm
·
agent
·
评测
·
科学发现
·
google research
评科研 LLM/Agent:从读论文抽检到 ERA 树搜索写可计分实证软件
千笔-AIWritePaper · https://www.aiwritepaper.com「模型会不会做科学」很容易停在聊天印象:答对几道题、复述几段摘要。Google Research 在 ICTS 相关公开分享里强调另一条路:先评测模型在真实科研工作流上的缺口,再把算力花在可计分的实证软件迭代上。Nature 论文描述的 Empirical Research Assistance(ERA)把大模型提案与树搜索结合起来,在沙箱里执行候选代码、用明确指标打分,并在生物信息、流行病学预报等多个基准上报告专
青山科技分享
15 天前
邮件
·
外贸
·
评测
外贸获客AI哪家强?2026年主流工具横向评测
这两年, 在外贸行业里, 最热的关键词, 那必然是“AI获客”了。然而, 面对市场上、不断涌现出来的AI工具, 外贸老板们, 最大的困惑常常是: 这些工具, 究竟能不能真的帮自己找到客户, 又或者, 是另一个、价格高昂的“自动群发垃圾邮件”软件呢? 怀揣着这个问题, 我耗费三周时间, 针对市场上主流的6款外贸获客AI工具, 展开了深度实测。
nix.gnehc
2 个月前
人工智能
·
eval
·
评测
工具选型:5 个工具对比
② 评测全景列出了 5 个工具。本节不是直接讲某一个工具,而是从选型维度出发,帮你根据自己的场景做选择。
nix.gnehc
2 个月前
人工智能
·
eval
·
评测
评测工程化:从手动到持续
③ 评测思维框架的决策树到"评测方案确定"就停了:方案确定后,还有四步工程化工作:判分实现(规则校验/LLM-as-judge/两层配方)已在④ 评测实践中展开,本文不重复。本文聚焦"怎么持续跑"。
nix.gnehc
2 个月前
人工智能
·
eval
·
评测
评测认知基座
本文是「智能体评测系统认知」系列第 ① 篇。系列导航:传统软件测试建立在一个前提上:相同的输入产生相同的输出。
寒山李白
3 个月前
ai
·
大模型
·
gemini
·
评测
Gemini 2.5 Flash Lite 实效表现与能力边界全景解析
✨ 在实际开发工作中,我们常常面临这样的困境:面对海量的文档资料,如何快速提取核心信息?在构建复杂业务逻辑时,又该如何确保推理的严密性?尤其是当我们需要处理跨模态任务,比如从图表中读取数据并生成分析报告,或者在长达数万字的上下文中定位关键代码片段时,传统工具的局限性便暴露无遗。对于许多技术团队而言,选择一款能够真正理解意图、响应迅速且具备深度推理能力的智能助手,已经不再是“锦上添花”,而是提升研发效率的关键环节。
qcx23
4 个月前
人工智能
·
rag
·
评测
【系统学AI】15 RAG评测体系:RAGAS四维+TruLens+ARES全套方案
title: “RAG评测体系(2026版):RAGAS四维+TruLens+ARES全套方案” excerpt: “Faithfulness/Answer Relevancy/Context Precision/Context Recall四维评测+LLM-as-Judge最佳实践+持续监控+A/B测试” cover: rag-evaluation-cover.png tags: RAG评测, RAGAS, TruLens, ARES, LLM-as-Judge, 评测框架
北京地铁1号线
8 个月前
自动化
·
rag
·
评测
·
ragas
·
trulens
5.1 RAG系统的自动化评测
目录一、RAG评估的重要性与挑战为什么需要专门评估RAG?评估的四大挑战二、核心评估指标详解1. Faithfulness(忠实度/真实性)
PeterClerk
8 个月前
人工智能
·
python
·
深度学习
·
计算机视觉
·
benchmark
·
评测
计算机视觉常用指标(Metrics)速查与解释(持续更新)
适用范围:分类 / 检测 / 分割 / 跟踪 / 检索 / 图像复原 / 生成评估 / OCR 说明:不同论文/代码实现对细节(阈值、插值方式、忽略类、边界处理等)可能略有差异,使用前建议核对对应 benchmark 的官方实现。
wavemap
10 个月前
服务器
·
阿里云
·
云计算
·
vps
·
评测
·
boboforum
阿里云38元一年200M轻量云服务器详细评测
大学生做的原文论坛链接:阿里云200M轻量云服务器详细评测前段时间阿里云的轻量服务器带宽升级到200Mbps的峰值带宽,实名认证后的新人只需要38一年。琢磨着喝一杯Coffee的钱都不要能搞一台2H2G的云服务器一年,这不就当是送的吗?这就搞了一台北京的机器来评测下,看看有多拉(Bushi) 😹
日落ོ࿆ྂ
2 年前
功能测试
·
可用性测试
·
评测
阿里云操作系统智能助手OS Copilot实验测评报告
简介: **OS Copilot 产品测评摘要**- 学生使用,用于学习和编码,发现上手难度较高,指引文档不清晰,特别是Access ID设置和代码复制流程。- 功能上,评分9分,辅助编程和知识问答功能显著提升了学习效率,减少了错误。- 愿意推荐,并有兴趣参与开源开发以提升自我。- 希望增强错误排查,提供具体错误原因和位置。- 联动ACK智能助手可增强学习效果。
我是有底线的