首个AI程序员:能接单干私活,自动微调大模型!

AI初创公司Cognition在官网发布了首个AI程序员------Devin。同时获得了2100万美元A轮融资。

其实,AI编程这事不新鲜,ChatGPT、Github Copilot、讯飞星火、文心一言等通过问答方式都能轻松完成。

Devin的神奇之处在于,不仅能反馈答案还能 像人一样实现端到端的部署、调试、优化代码,对整个开发项目进行缜密的计划,微调大模型等,几乎与编程相关的任务都能自动化完成。

其展示的案例中,在Upwork(自由工作平台)上为Devin找了一个编程的私活,要求提供一份关于Github的视觉模型的配置和推理文件。

当Devin接到任务后,从代码库拷贝、配置、Bug修复、代码更新、调试运行等全部自己独立完成,最后提交了成功运行结果以及一份详细的配置文件。性能非常强悍,感觉像是一个智能代理+ChatGPT的结合体。

目前,Devin处于内测阶段对这个产品感兴趣的小伙伴,可以点击阅读全文申请试用资格。

Devin其他功能展示

除了接单干私活之外,Cognition还展示了Devin其他超强功能。例如,发送一个Github存储库,然后按照其文档说明来微调Llama-7B大模型。

**Devin:**没问题,我会查看存储库并按照Readme中的说明对Llama7B模型进行微调。首先,我需要克隆存储库并查看文档以了解全部过程,随时会向开发者通报最新进展。

接着,Devin在部署的时候遇到了问题,是一个关于Nvidia配置的事情,很快它便自行解决开始了模型微调工作。

在微调的过程中,开发者也可以将Devin设置成待命状态,就不会主动执行监督微调工作,可以帮你完成其他任务。

经过大约1小时的时间,询问Devin微调进行的怎么样了?它会告诉你,在计划中的1万次迭代中,已经完成了404次损失值总体呈下降趋势效果显著,并且会持续监视,当出现任何问题时会及时向你汇报。

Devin可以轻松处理开源软件源中的错误和功能请求,只需提供 GitHub的链接,就能快速完成所有关键设置和上下文收集。

Devin还具备自学能力,例如,开发人员将一篇博文发送给了Devin,使其学会了如何在模态上运行 ControlNet,并按照要求生成一些图像。

Devin可以自主查找并修复代码库中的错误,例如,Devin 帮助开发人员维护和调试他的开源库并找出错误和优化方案。

Devin性能评测

开发人员在评估平台SWE-bench对Devin进行了综合测试,需要AI在 Django、scikit-learn等开源项目中,发现真实GitHub出现的问题并进行修复。该评测一共有"无人协助"和"有人协助"两种模式

结果显示,在无人帮助的情况下,Devin 端到端正确地解决了13.86%的代码问题,超过了之前由Claude 2保持的1.96%记录

有人协助评测报告(Devin依然使用的是无人模式)

即便是有人协助下,Devin还是以13.86%成绩超过了GPT-4、GPT-3.5、Claude 2等知名大模型。

Cognition简单介绍

根据彭博的介绍,Cognition是一家成立不到2个月的小公司,办公地点是一间从Airbnb租的小公寓。

但其10位初创人员来头不小,人手一枚IOI 金牌(国际信息学奥林匹克竞赛),同时在Scale AI、Google DeepMind、Waymo 和 Nuro等顶级AI公司担任过领导岗位,对AI的功能创新有很深的理解以及开发能力。

Cognition初创团队

最近,Cognition获得了由Founders Fund领投的2100万美元A轮融资,Patrick Collison、John Collison、Elad Gil等个人投资者跟投。

Cognition表示,Devin只是一个开始,未来会尝试推出更多功能强大实用的AI产品。

本文素材来源Cognition官网,如有侵权请联系删除

相关推荐
七七powerful1 分钟前
运维养龙虾--Tmux 终端复用器完全指南:从入门到 AI Agent 远程操控
运维·服务器·人工智能
七夜zippoe5 分钟前
OpenClaw 飞书深度集成:文档操作
人工智能·飞书·集成·文档·openclaw
databook5 分钟前
从写代码到问问题:2026年,AI如何重构数据科学工作流
人工智能·后端·数据分析
深山技术宅11 分钟前
OpenClaw 系统架构深度解析
人工智能·ai·系统架构·openclaw
skilllite作者12 分钟前
AI 自进化系统架构详解 (一):重新定义 L1-L3 等级,揭秘 OpenClaw 背后的安全边界
人工智能·安全·系统架构
m0_6948455712 分钟前
CRUD (Nestjsx)部署教程:自动生成RESTful接口
服务器·人工智能·后端·开源·自动化·restful
瑶光守护者14 分钟前
【一文读懂】OpenClaw系统架构分析:自主人工智能智能体的范式迁移与技术底座分析
人工智能·笔记·学习·系统架构·边缘计算·openclaw
天地沧海14 分钟前
性能测试分析
人工智能
百卷-星河15 分钟前
AI大模型深度分析后总结的OpenClaw大龙虾系统架构概览
人工智能·系统架构
MRDONG115 分钟前
Prompt Engineering进阶指南
人工智能·深度学习·神经网络·机器学习·自然语言处理