评估

小北的AI科技分享11 天前
运维·模型·评估
企业AI开发:从技术选型到落地的关键路径这两年间, 我去走访了二十多家正处于推进AI转型进程当中的企业, 然后发现了这样一个普遍存在的现象哟: 大多数企业其实并不缺失可以利用的AI工具, 所欠缺的乃是能够真正将AI运用起来的开发团队。现如今在市面上现成的AI产品是相当多的, 然而真正能够贴合业务场景的那些, 往往是需要进行定制开发的。这样一来, 就催生出了一个呈现快速增长态势的服务领域嘿——企业AI开发。
承渊政道18 天前
api·网站开发·评估·蓝耘元生代·workbuddy·glm-5.2·模型接入
从模型接入到官网落地:我用蓝耘元生代和WorkBuddy完成了一次AI开发实践随着大模型能力不断进入真实开发场景,AI 编程工具的价值已经不再局限于代码补全,而是逐渐覆盖需求分析、项目搭建、页面开发和本地预览等完整流程.对于开发者而言,如何选择稳定的模型服务,并将其接入熟悉的开发工具,成为提高实际工作效率的重要一步.本次实践中,我通过蓝耘元生代MaaS平台接入GLM-5.2模型,并将其配置到 WorkBuddy 中,以"智能团队项目协作与效能管理平台"为业务背景,完成了一个包含首页、关于我们、产品服务和联系我们四个页面的企业官网.从模型服务数据评估、API Key 创建,到模型接入
冷小鱼24 天前
大模型·微调·优化·迭代·评估
Agent 大模型的后训练、微调、评估与迭代优化:从理论到工程实践摘要:随着大语言模型(LLM)从 “对话助手” 向 “自主 Agent” 演进,模型需要具备复杂指令理解、多步推理、工具调用和动态决策等能力。本文系统梳理了 Agent 场景下大模型的后训练(Post-Training)、微调(Fine-Tuning)、评估(Evaluation)与迭代优化(Iterative Optimization)全链路技术体系,结合最新研究进展与工程实践,为构建高性能 Agent 提供方法论指导。
SunnyRivers4 个月前
优化·rag·评估
RAG 评估与优化在本综合教程中,学习如何使用 LangChain 评估和优化 RAG(检索增强生成)系统。掌握 RAGAS 框架、A/B 测试策略、性能指标以及面向生产环境的 RAG 系统分步优化技术。
沛沛老爹8 个月前
前端·人工智能·llm·agent·rag·评估
Web开发者实战RAG评估:从指标到工程化验证体系图片来源网络,侵权联系删。在Web开发中,我们习惯用单元测试、E2E测试、性能监控来保障系统质量。但当引入RAG(Retrieval-Augmented Generation)后,传统测试方法失效了:
山顶夕景8 个月前
大模型·agent·评估·评测集
【Agent】Evaluation and Benchmarking of LLM Agents: A Survey现在 LLM Agent 越来越复杂: 会规划、用工具、有记忆、能多轮互动、能协作但 评测方法仍停留在 LLM 级别:
Yeliang Wu8 个月前
linux·ubuntu·llama·评估·llamafactory
LLaMA-Factory 模型评估理论与实战:基于 Ubuntu 22.04 的系统化指南在开始实践前,理解评估指标背后的逻辑至关重要。通用能力评估指标特定任务评估指标以下是两种主流的部署方式,Docker方式能最大程度避免环境冲突,推荐使用。
艾策第三方软件测评1 年前
测试·软件·评估
软件产品测试报告:如何全面评估及保障软件质量?软件产品测试报告可以对软件产品质量做全面评估,还能够把评估结果展示出来,它依靠一系列测试手段和数据分析,能为产品的完善以及决策提供重要依据。下面从不同方面展开说明。
wxl7812271 年前
pdf·openai·评估·问答
根据pdf文档生成问答并进行评估目标是根据pdf文档生成问答,并进行评估。首先,安装依赖pip install PyPDF2 pandas tqdm openai -q
SpikeKing2 年前
人工智能·开源·大模型·多模态大模型·评估·雷达图·vlmevalkit
LLM - 多模态大模型的开源评估工具 VLMEvalKit 部署与测试 教程欢迎关注我的CSDN:https://spike.blog.csdn.net/ 本文地址:https://spike.blog.csdn.net/article/details/144353087
伊织code2 年前
自然语言处理·nlp·文本分类·transformers·评估·inference
NLP transformers - 文本分类本文翻译自:Text classification https://huggingface.co/docs/transformers/tasks/sequence_classification notebook : https://colab.research.google.com/github/huggingface/notebooks/blob/main/transformers_doc/en/pytorch/sequence_classification.ipynb
政安晨2 年前
深度学习·神经网络·回归·评估·模拟退火训练
政安晨:【深度学习神经网络基础】(八)—— 神经网络评估回归与模拟退火训练目录简述评估回归模拟退火训练政安晨的个人主页:政安晨欢迎 👍点赞✍评论⭐收藏收录专栏: 政安晨的机器学习笔记
自律版光追2 年前
人工智能·语言模型·自然语言处理·llm·论文·评估·survey
【ReadPapers】A Survey of Large Language ModelsLLM-Survey的llm能力和评估部分内容学习笔记——思维导图思维导图
小黄人软件3 年前
安全·hash·密码·哈希·评估·保存在本地
MFC哈希实现 目标:知道初始密码的人,才能改密码及登录。只知道登录密码只能登录。避免密码直接写在代码里或本地,通过软件评估报告。----安全行业基础5条件1实现:https://blog.csdn.net/chenhao0568/article/details/134654801?spm=1001.2014.3001.5501 条件2实现:逻辑了。 条件3实现:https://blog.csdn.net/chenhao0568/article/details/134654768?spm=1001.2014.3001.5501 条件4实现:https://blog.csdn.net/chenhao0568/article/details/13465474
冰露可乐3 年前
决策树·数据挖掘·聚类·国考·网警·评估
数据挖掘:关联规则,异常检测,挖掘的标准流程,评估指标,误差,聚类,决策树2022找工作是学历、能力和运气的超强结合体,遇到寒冬,大厂不招人,可能很多算法学生都得去找开发,测开 测开的话,你就得学数据库,sql,oracle,尤其sql要学,当然,像很多金融企业、安全机构啥的,他们必须要用oracle数据库 这oracle比sql安全,强大多了,所以你需要学习,最重要的,你要是考网络警察公务员,这玩意你不会就别去报名了,耽误时间! 与此同时,既然要考网警之数据分析应用岗,那必然要考数据挖掘基础知识,今天开始咱们就对数据挖掘方面的东西好生讲讲 最最最重要的就是大数据,什么行测和面
我是有底线的