RSI“真“”来了,OpenAI和Anthropic把人类逼到墙角!

最近 RSI 这个词很火,马斯克、奥特曼、达里奥都在说要减缓 AI 模型的训练。一旦 RSI 全面启动,未来 AI 可能毁灭人类。

RSI 的意思大概是:

Recursive Self-Improvement 指 AI 系统具备自主设计、实现、评估并优化下一代自身或后继系统的能力。

好的,基于这个场景。

我让 GPT-6 和 Opus 5 开发了一个游戏,名叫:《最后一座桥》

背景故事大概是 AI 觉醒,机器人占领了整个大陆。仅存的人类被逼到了一个岛屿上!

这个岛屿和大陆之间就一座桥,一旦 AI 机器人攻占了这座桥,人类就噶了~~!

游戏的主角,就是这座桥的守卫者!

它需要扛住一波又一波的进攻,它的对手是各种各样的机器人!

我让 OpenAI 的 Image 2.5 做了几张概念图:

主角的第一视角:

反派造型:

场景和道具:

武器:

因为涉及到"末日求生",它的第一个版本是比较灰暗那种,我不太喜欢脏兮兮的感觉,所以让它做了这套比较明亮的风格。所有图片,都是一次生成的,并没有进行任何优化,仅供参考。

如果这个效果能做出来,那不直接就是 3A 大作了,直接上 Steam!

当然,这是不可能的。

我们只是试一下参考图有没有用,以及它们能把游戏做到什么程度!

经过极其漫长(1 天)的制作,游戏基本上能玩了!

GPT-6 的结果

下面先来看一下 GPT-6 的结果。

它的游戏封面是这样的:

封面做得还挺漂亮的,它的封面好像都是这种风格,好看,但是一成不变。

左上角有 M 的图标,然后一个 MORI 的拼音。

游戏的名字叫"最后一桥"! 上面有一句英文"THE LAST HUMAN OUTPOST",大概是"人类最后据点"的意思!

还有一些描述,比如"HODL THE LINE",大地已经属于机器人,桥的另一端,是人类最后的城市,守住这座桥,直到黎明。

然后是一个黄色的按钮!

下面有一个武器试射场,这里面所有的武器都解锁了,可以快速体验。

然后还有一个按钮是继续上一次防线,就是可以接着玩上一次的进度。

这是一个战术防守、16 波渐进攻势、离线单人的游戏。

操作也很简单,主要就是上下左右移动鼠标射击瞄准。

这个游戏其实是兼具了塔防和射击游戏的概念。

既可以体现操作,也可以体现策略。

然后,我让 GPT-6 帮我做了一批截图,我挑选几张给大家看一下具体的游戏界面。

进入游戏之后先要做防线整备:

可以在桥面上设置装甲路障、感应地雷、电磁塔、哨戒炮等。

然后可以购买和强化武器,主要的武器包含了突击步枪、重型散弹枪、电磁狙击枪以及榴弹发射枪。

下面是战斗界面:

战斗界面的话,上下左右都有一些辅助信息。

譬如左下角有战术雷达,可以显示敌人的位置,然后有操作提示。右下角是武器选择和状态显示。右上角是城市完整度,主要包含了生命、物资、击破等数据信息。

再来给大家一个特写:

这个 OpenAI 的 logo 确实贴得有点水啊,但是挺好的,要的就是这种很糙的风格。其实它这个灰不溜秋的机器人设计还蛮有意思的。

整个游戏呢,就是有不同的武器、不同的敌人,以及不同的波次,大概总共是 15 个波次。目前体验下来,难度适中,作为一个小游戏玩玩还可以。

它自主规划的这个色调啊、游戏氛围啊,整体来说还可以的!

当然第一版是没法看的,我也是改了好几次的,如果是 GPT-5.6 的话,你让它改,它可能改不出什么东西。

但是 GPT-6 确实上限更高,当我提出问题之后,它是进行了很大的提升的。

当然游戏好不好,重要的还是手感。下面请看 VCR!

视频地址

Opus 5 的结果

看完了 GPT-6 的表现,我们再来看一下 Opus 5 的表现。 按理说是应该拿 Fable 5.1 来进行测试的。但是,由于我太穷了,API 付不起,所以就用 Opus 5 来顶一下吧。

先来看一下封面:

这比例,好像搞了 19:6 的巨幕效果。

Opus 5 的封面很简单,就一个巨大的名字叫"最后一座桥"。然后下面一个英文叫 BRIDGE SIEGE。

然后就是一个点击任意处进入的按钮。

底部还有一段描述:"机器人崛起之后,人类最后的岛屿要塞,全程序化 3D,无外部资源。"

然后整个背景就是游戏的一个画面。

稍微备注一下,就是这两个模型开发的整个游戏,基本上都是没有外部资源的,都是程序化建模和贴图以及音效。

所以最后的文件都是比较小的,大概在一兆左右。

GPT-6 因为它有生图能力,在后面的轮次中,我让它制作了贴图。

Opus 没有这个能力,只能是自己画了!

首页点进来之后,就会进入这个界面:

这个界面信息量还是挺大的! Opus 5 的第一个版本完成度要比 GPT-6 高很多!

它这里设计了四种难度,分别是侦察兵、士兵、老兵和最后的防线。不同难度下,生命、伤害、起始废料都是不一样的。

然后它还做了一个简报,交代了一下这个背景信息!

右边展示了所有的敌方单位、武器、攻势、机制与操作说明。

这样一看就很清晰了,我到底有哪些敌人?它们有哪些特性?然后我可以用的武器有哪些?用的防御工事有哪些?整个游戏的机制是什么样子的?有哪些具体的操作?

然后我让它自己做了一批截图:

接下来我就挑几张给大家展示一下。

这里也可以稍微展开一点点。我是用同样的指令要求它们两个都给我截图,我的要求是,要包含主要的场景、角色、道具信息。GPT-6 只是给了我 12 张图,而且没有按照我的要求截图。

Opus 5 基本上严格遵循了我的要求,是对各种类型进行了截图,而且截得很全面。图片数量在 30 几张!

俯瞰图:

第一视角图:

大规模进攻图:

侧视图:

Boss 进攻图:

防御工事:

防御工事主要包括了混凝土路障、破甲刺条、HE 压发地雷、燃油桶、自动哨戒炮、特斯拉线圈、桥面爆破装药、装甲隔断。

其中它这个自动哨戒炮和特斯拉线圈很猛。有这两个基本上无敌了。

它这类型也是挺全面的,各种角度都考虑到了。

我们开始的那个界面里,详细地介绍了它们的结构特征、伤害、半径、射程等信息。

敌人:

敌方单位,它总共设计了10种。

这 10 种敌人包括了拾荒者、哨界者、爆破蛛、蜂群单元、盾卫、悬浮炮舰、修复单元、干扰者、碾压者、泰坦。

其中的泰坦设计得特别巨大,我第一次打,死活打不过去。

然后问了一下 Opus 5,它告诉我它的弱点在背后,我当场无语了,Opus 马上意识到了问题,主动开启修改了。

重新设计之后,好打了很多。

具体的介绍如下:

这参数设计已经非常全面了,我表达能力有限,只能用"全面"来描述了!

武器图:

武器设计依旧非常全面,GPT-6 是同一个建模下面修改不同的武器,Opus 5 是同一个风格不同的建模。

游戏平衡设计的也很不错。

这一切都是它自主完成的,我并没有提供任何玩法和参数的细节。我甚至没有提过一个角色和武器的名字。

具体的效果请看VCR:

视频地址

虽然我已经用了很多次了,但是我还是不免有些感慨。

牛逼的模型,自主性非常强! 你一个眼神,它就心领神会了。而普通的模型,就疯狂地骂它,它依旧错漏百出,骂一句走一步,然后退一步。

说到这里,我再多说几句:

就是之前我给大家测试 DS,我说 DS 不行,然后知乎上一堆人嘲笑我"不会写提示词"。(我写的提示词,比它们见过的都多😄)。

其实我测的是模型的自主性。

AI 都已经发展到这个阶段了,还在拿提示词说事儿的人,多少是有点问题。并不是说提示词不重要,而是在同样的提示词下面,不同的模型它的自主性和全面性完全是不一样的。

就像我对 Opus 5 说,你要做一个完成度较高的游戏!它就真的会做一个完成度很高的游戏。如果我对很多其他模型说同样的话,结果就非常简陋。这种差异,真的是只有全面对比过才会有深刻的认识。

DS 在部分基准中超过了 Opus 5,感觉很强的样子。但实际上它们之间的差距绝对不是一丁半点。不信的人,可以拿同样的场景去测试一下!

不好意思,DS又躺枪了啊,本来这个题目跟它无关! 只是有些人"拿无知当专业",让我哭笑不得!

说回今天的主角。

在自主完成的第一个版本中,我觉得 Opus 5 的整体效果要好一些,这个效果主要是指内容丰富度以及这个参数之间的平衡。

但是它这个场景建模和风格一直没有达到我想要的那个效果!它第一个版本也是灰色的,但是那种灰吧,就是很难看。然后我就直接让它做一个亮色的。

视觉效果这部分,Opus 5 让我有点失望,主要原因是它上次的坦克世界太强了,导致这次有巨大的落差!

而 GPT-6 这个默认的风格,我觉得还不错。

它还自主调用图片生成功能,设计了比较合适的贴图。Codex 在功能上就很全面了,既有大语言模型,又有图片模型,一组合,那就是跨维度打击。

另外一点值得注意的是,我虽然给了它们参考图,但是它们参考的成分非常有限。

它们还是按自己的思路来设计了这个角色和场景。然后它们在设计的时候,很多元素其实是比较接近的。比如说各种武器、敌人类型、名字,以及整个波次设计。

可能末日题材容易激发类似的记忆!

整个看下来,虽然没有达到效果图里那种效果,但是我觉得已经做得很不错了。

能自主完成建模、设计场景、设计玩法、设计各种参数,然后自己进行测试,最后在几个小时内做出这样的效果,应该说很不错了。这要是放在十几二十年前,这不就是一个大作吗?

玩法有了,以后就只要优化建模、战斗效果、音效就可以了。理论上这些也可以用专门的AI工具来完成。

稍后我把这两个游戏上传到topai,有兴趣的可以去玩玩!

具体网址:

topai.jarvisuni.com/

未来,我们就不单独测试单点功能了,也不再测试那些"边缘"模型了。我只想把时间浪费在那些牛逼的模型上面,测试它们的极限。

以后会多分享作品,少评论! 我只要说 XX 不好,总是会让有些人不开心。

那就:Stop talking. Show my(your)demo

以后测评,不管好坏,我都说,哇这个"牛逼",这个"屌炸天",这个"宇宙无敌"了。哈哈哈!

其实测评很无聊的,如果我不是自己想知道结果,我绝对不会去测。

真的还不如自己搞个 demo,自娱自乐,来得有趣。

最后再说一下标题中的 RSI,只能说AI领域的概念是真的多~~

比如这一句话:"AGI 通过 RSI 持续自我改进,最终进入 ASI 阶段。"

大家都当笑话看了!

但是认真来说,我觉得奥特曼、达里奥、马斯克,他们说得有一定道理,并不单纯是营销而已。

目前顶级的 AI 模型确实非常强大了,如果一旦开始自我迭代,套上肉身,那确实是蛮恐怖的。如果人类无法卡住关键点,不做好对齐,那未来确实不堪设想。

我希望我这个游戏只是一个游戏,不要变成现实。我不想成为这个游戏里的主角。我就玩玩游戏就可以了。

另外大家可以评论下,单纯从效果来说,GPT6和Opus5哪个好一些?

相关推荐
大模型码小白1 小时前
告别造假数据,直接连数据库查真实时序数据喂给 TimechoAI 大模型
java·数据库·人工智能·microsoft·架构
IvorySQL1 小时前
PostgreSQL 日报|建库策略致备库静默丢数据(9 月 12 日)
数据库·人工智能·postgresql
来两个炸鸡腿1 小时前
【Datawhale2609】算子开发实战 task01-熟悉沐曦GPU
人工智能·学习·大模型
opensnn1 小时前
AI竞争进入生态时代:OpenCL为何值得关注
人工智能
狼与自由2 小时前
MCP协议理解
人工智能·架构
夜雪一千2 小时前
如何使用Python做舆情分析
人工智能·python·数据分析
wangqiaowq2 小时前
AI Infra 全栈技术栈 二
人工智能
azhou的代码园2 小时前
景区游船预约服务系统
人工智能·spring boot·后端