论文阅读

西柚小萌新10 小时前
论文阅读
【论文阅读】-- 面向多模态检索增强生成(MRAG)的知识投毒攻击多模态检索增强生成 MRAG 借助外部知识库提升视觉大模型 VLM 的推理能力,但它的安全漏洞研究还很少。本文提出 MRAG‑Corrupter 知识投毒攻击,向知识库注入少量精心构造的图文对,操纵 VLM 输出攻击者期望回答。将攻击建模为优化问题,根据攻击者的访问权限提出dirty‑label、clean‑label两套跨模态策略。 在 InfoSeek、OVEN 知识库、多款主流 VLM 上实验:仅向 48 万 + 条的 InfoSeek 数据库注入 5 条恶意图文对,攻击成功率最高可达98%;现有多
Rocky Ding*11 小时前
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·ai agent
【三年面试五年模拟】2026-08-18_哔哩哔哩_AI应用岗Agent开发一面面经(含完整答案)欢迎大家关注Rocky的知乎:Rocky Ding 《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源:【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book,欢迎大家Star~
m4Rk_12 小时前
论文阅读·人工智能·学习·开源·github
【论文阅读】Agent 记忆机制(50):PACE——按下一步预测价值动态分配历史记忆粒度前面已经阅读了 A-MEM、MemoryOS、Nemori、MAGMA、HiAgent、Agentic Plan Caching、3DLLM-Mem、Mem²Evolve、Chain-of-Memory、ReMemR1 等不同方向的 Agent Memory 工作。
传说故事14 小时前
论文阅读·人工智能·生成模型
【多篇论文阅读】Interactive World Models类型判断:改造原理/配方(不是从零新架构)。本质是:给已有双向 video Diffusion 补两样能力——只能看过去、能跟帧级 action 走。
传说故事2 天前
论文阅读·人工智能·生成模型
【论文阅读】Whole-Body Conditioned Egocentric Video Prediction题目:Whole-Body Conditioned Egocentric Video Prediction 时间:2025年6月(arXiv) 机构:UC Berkeley、Meta FAIR、NYU 关键词:egocentric video prediction, whole-body pose, diffusion transformer
chnyi6_ya2 天前
论文阅读·笔记
论文阅读笔记 | From Priors to Perception: Grounding Video-LLMs in Physical RealityVideo-LLM 在通用视频理解上已经很强,但在细粒度物理推理上系统性失效:悬浮、刚体穿透这类明显违反物理的现象都识别不出来。以往的解释是"模型只学到了视觉-文本相关性",本文进一步追问:这到底是感知不行,还是推理被劫持?
m4Rk_2 天前
论文阅读·人工智能·学习·开源·github
【论文阅读】Agent 记忆机制(49):MemCoE——先学习如何组织记忆,再学习具体记住什么假设一个用户在很长一段时间里与个人 Agent 持续交流。最开始,他说自己刚加入网球俱乐部;过了一段时间,他开始频繁讨论动作电影;再后来,他把大量精力投入数学课程。几个月后,用户问:“我现在适合参加什么活动?”
m4Rk_3 天前
论文阅读·人工智能·学习·开源·github
【论文阅读】Agent 记忆机制(48):Fine-Mem——用细粒度奖励解决长期记忆管理中的奖励稀疏与信用分配假设一个 Agent 要连续处理一百段项目记录。每读到一段新信息,它都可以执行四类操作:新增一条记忆、更新旧记忆、删除过时记忆,或者什么都不做。等一百段信息全部处理完,再让它回答:“最终采用了哪个接口方案?为什么放弃上一版?”
tangjiawen101794 天前
论文阅读
AI没有规模化路径的创新,只是昂贵的演示《AI试点已死,价值闭环崛起》 ——没有规模化路径的创新,只是昂贵的演示企业AI最危险的状态,不是没有试点,而是试点遍地、价值为零。
m4Rk_3 天前
论文阅读·人工智能·学习·开源·github
【论文阅读】Agent 记忆机制(47):Nemori——用“预测误差”判断什么经验值得被记住随着 Agent 与用户持续交互,系统会不断接收新的对话、任务结果和环境反馈。一个长期运行的 Agent 可能每天产生几百条消息。如果将所有内容完整保存,记忆库会迅速膨胀,检索时也会出现大量重复信息。
tangjiawen101793 天前
论文阅读
AI安全,CEO不该只做甩手掌柜《所有CEO都在错误方向上抵御风险》——最大的漏洞不在代码里,在组织架构里攻击方已经用上AI,防守方还在走流程。
Rocky Ding*4 天前
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·ai agent
【三年面试五年模拟】2026-08-18_哔哩哔哩AI应用岗Agent开发一面面经全解析(含完整答案)欢迎大家关注Rocky的公众号:WeThinkIn 欢迎大家关注Rocky的知乎:Rocky Ding 《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源:【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book,欢迎大家Star~
chnyi6_ya4 天前
论文阅读·笔记
VideoHallu 论文阅读笔记论文标题:VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding 会议:NeurIPS 2025 机构:University of Maryland, College Park / University of Southern California 代码/数据:https://github.com/zli12321/VideoHallu.git
心心喵4 天前
论文阅读
[论文笔记] paper review PPTGitHub - AI-Efficiency/Awesome-Model-Quantization: A list of papers, docs, codes about model quantization. This repo is aimed to provide the info for model quantization research, we are continuously improving the project. Welcome to PR the works (papers,
m4Rk_6 天前
论文阅读·人工智能·学习·开源·github
【论文阅读】Agent 记忆机制(45):ReMemR1——让长期上下文 Agent 可以回溯历史记忆进行非线性推理前面已经阅读了 A-MEM、MemoryOS、MAGMA、Chain-of-Memory 等不同类型的 Agent 记忆方法。
m4Rk_8 天前
论文阅读·人工智能·学习·开源·github
【论文阅读】Agent 记忆机制(43):Mem²Evolve——让经验与能力在双记忆中共同进化前面阅读的 Agent 记忆工作,大多在回答一个问题:Agent 应该怎样保存、组织和召回过去的信息?
m4Rk_9 天前
论文阅读·人工智能·学习·开源·github
【论文阅读】Agent 记忆机制(41):Agentic Plan Caching——将历史执行轨迹转化为可复用的计划记忆# 前言前面已经阅读了 A-MEM、Mem0、MemoryOS、Nemori、MAGMA、HiAgent 等不同类型的 Agent 记忆方法。
m4Rk_10 天前
论文阅读·人工智能·学习·开源·github
【论文阅读】Agent 记忆机制(40):HiAgent——通过子目标级记忆提升长程任务执行能力前面已经阅读了 A-MEM、Mem0、MemoryOS、Nemori 等不同类型的 Agent 记忆方法。
m4Rk_16 天前
论文阅读·人工智能·学习·开源·github
【论文阅读】Agent 记忆机制(35):MAGMA——用多关系图与意图路由实现结构化长期记忆检索前面已经阅读了 A-MEM、Mem0、MemoryOS、Nemori 等不同类型的 Agent 记忆方法。
柳叶方舟11 天前
论文阅读·人工智能·深度学习·交互·健康医疗
Nature Medicine IF=50.0 | 公众医疗助手LLM可靠性存隐忧:真人交互表现未优于对照组,现有评估基准失效大语言模型(LLM)在医学考试中屡获高分,被视为公众获取医疗建议的潜在“新门户”。然而,一个核心痛点在于:这些在标准测试中表现优异的模型,在真实、动态的人机交互场景下,能否真正帮助普通人做出可靠的医疗决策?