改硬件/做3D/PPT/自动剪辑/… GPT-6 Astra的重置额度我一篇实测完了

0 评论 100 浏览 0 收藏 21 分钟

OpenAI把GPT-6 Astra全量上线后,作者实测其computer use电脑自动化。新推理强度UI做成进度条,滑到最左降级回5.6,只有轻度、中、极高三档。他用77块外置键盘三键唤起CodeX,检验能否完成改快捷键、3D、自动剪辑。

奥特曼!openai!你做推理强度给我做好了啊,害我以为UI都错了,怎么只有轻度,中,极高,而且往左滑,我本来以为有六档的推理强度,结果往左滑又一下子重复变成轻度,中,极高。我当时还以为 OpenAI的UI是不是中文的没有做好,把它切成英文再仔细看看。

结果它现在是一个进度条,滑到左边就会降级到5.6。我不知道这个UI是哪个天才想出来的。

我还以为能够发好几天重置卡呢,结果只是推迟一天就把这个模型全量上线了。现在有点处于那种高兴跟不高兴的叠加态。我看现在发的大部分都是3D游戏的case,但我想先试试它这个牛得不行的computer use(电脑自动化)是不是能够稳定发挥。

所以我掏出了两周前77块买的一个外置键盘,上面有三个自定义按钮。大部分人都会这么设置,先点第一个键,快速唤起CodeX,第二个键,语音输入,第三个键,发送。

之前我用GPT 5.6设置的时候出了巨多错误。

首先,computer use不能去修改CodeX自身的快捷键,gpt5.6分不清「全局唤起 Codex」跟「应用内新建对话」是两个完全不同的动作,把应用内快捷键写进了键盘全局映射,这样的话只要我不是在gpt对话界面的话这个键盘就是一个美丽废物,最后还是我手动改的。

但gpt6是一次性一把成功的,只用了41秒。

都不需要我手动调整codex自身快捷键,它就完成了。

同样的方式我尝试把鼠标也做成一个vibe coding的硬件看看。

因为我打算做一个对比系列就是多少钱预算内,最便宜和最贵的硬件效果对比怎么样,值不值得买。刚刚那个键盘要77块。

这个鼠标是MX Anywhere 3s,499,算是500块预算里面的极致了。

OK,实际上来说,这个也是单个软件界面中算是比较复杂的操作了。我让GPT6给了些建议,设置了14个不同的功能,想要一次设置对。

当然,配置用到的Logi Options我也是让GPT-6帮我安装的,想说体验一下那种彻底懒人的感觉。

结果就是,除了在 CodeX 里面做语音唤醒要额外录入一个新的组合键以外,完全没有任何设置压力。

它现在已经给所有我常用的场景,浏览器,飞书,CodeX都设置了不同的快捷键,并且都能够准确地识别出来。比方说,我可以按后退键截图到剪贴板,然后直接发给CodeX,点一下前进键就可以直接唤起语音输入,点一下中键,CodeX就会跳出来。

按一下鼠标滚轮就更厉害了,在8个选项的基础上,还可以再点开,从4个AI 应用里面选择跳转。

这个外设比 77 块要值很多。

再就是经典的Blender环节,这两天我看到太多离谱的case了。

大家觉得这四个场景有一个是人搓出来的吗?

答案确实是没有。

所以我也把blender重新装了回来,就让gpt6给我手搓一个海盗船就好了。

离谱的是,GPT6做这个东西只花了不到 10 分钟的时间。

一开始看到的时候我其实都有点怀疑,它是不是偷偷作弊联网搜了几个现成组件帮我拼在一起了。所以我反过去提问它是怎么做出来的。它给出的答案是,没有下载任何现成船模,也没有用AI图片转 3D,还给出了每一个部位的生成逻辑。怎么生成木板,绳索,然后通过圆柱跟圆环的组合与自定义的网格,甚至给炮管做出来了空心的炮口。

这我直接开香槟了呀!

我将抱着一个开香槟的状态去测下面的case。

还是3D这块,当我看到藏师傅用S2.5的视频做参考发给GPT-6,做出这样一个3D甜甜圈的时候。

我就想到了前段时间能够通过白模视频发给S2.5,做出像《秒速5厘米》这样的画面。

其实这对建模能力的要求并不复杂,因为本质上哪怕把人建成两个长方体长着两只长方型的手走在路上,也可以顺利生成视频。它的价值在于你用白模完整控制了AI视频里的空间关系,谁在前谁在后,镜头怎么动,物体怎么交互等等等等。

问题是我只会建静物。

建模能力GPT6已经证明了自己具备了,那么建模之后还要把这样一段带镜头移动视频弄出来呢?我又给GPT6提了一个要求,拍一个15秒的3D物体移动镜头,就是上下楼梯的。

没错·,就是你的名字经典桥段。

可以看到,左边GPT6已经给出了怎么用3D物体拍视频的答案。

先搭个布景,然后给动作设置关键帧,Blender就会自己去计算每一帧的移动,所以不需要像我那么白痴拿 Blender里面的镜头动来动去,最后再逐帧渲染就可以合成视频了。

3D能力的提升,还一并带到了gpt6做3D游戏的能力上。

现在用一句话甚至可以把马里奥的三个关卡做成一个星球形状的3D游戏。

大家可以从我视频里面按键闪烁的频率,看到这一关有多难打。

首先你要躲开 BOSS 的两到三颗火焰球,然后趁BOSS矮化之后,一口气跳到他的头上。但是在跳的过程中不能碰到他的身体,不然就会减掉一条命。所以这个游戏关卡在它做出来之后,至今仍没有被打通过。

PS,前两天打卡。

在做上面那个白膜视频的时候,我看了一下codex可以比较稳定的从长视频里裁剪视频片段的,所以我又在想了,这篇文章为什么现在出来就是因为想测的真的太多了。

所以gpt6能不能结合之前比较火的剪辑Skill剪出来带动画的真人口播呢?

之前也用过Remotion,hyperframes,ChatCut,我觉得它们的问题在于,它们的确是能剪完视频气口以及重复读稿的多余片段,再追加一些MG动画。但在我这里是没能达到一个正常可以发布的视频的。我对AI剪辑的需求,是它能根据我们的习惯去剪辑。比方说,把这个视频可预见的结果,比方我讲怎么做AI图像的话前5秒就要说出来了,在这个基础上用动画要辅助说明,而不是重复字幕上的文字,这样才算是一个能发布的版本。

这次我让GPT6剪辑视频的时,经历过了三次修改。

第一版,它收到需求后去调研了其他剪辑的做法,结果做成了一个很雷霆视频的风格,整个视频几乎没有B-roll,有也被动画挡了一半。虽然绿黑色的画面是挺好看,但全是动画反而分散了注意力。

第二版,我让它看我写的脚本,可以联网搜索检索,可以对素材做适当的放大,缩小,滚动和拼接,让用户观看时有视觉重点。但这版用力过猛,直接把所有MG动画都去掉了,只留下原本的素材。

Pass。

第三版就比较满意了。有素材的阶段用了滚动,前5秒的效果我很喜欢。因为我拍的是竖版视频,但很多素材是横版的,很多时候只能上下拖动横版素材,gpt6的解决方法是放素材的同时追加说明文字。

还有一个细节,对于对话框的素材的处理,因为对话框的条很小,如果单独把整个页面放大,上下就会太空白没有素材,所以gpt6分了两层,下层放正常尺寸播放的视频素材,上层把文字拉大从左到右。

这样我又可以看到全局,又能看清文字提示语。

当然,这个剪辑依然有提升空间,我希望B-roll作为辅助信息时,用户看视频不需要眼睛从上往下不停倒腾,要么看全画面,要么在相近位置,减少明显的上下眼球移动,降低观看成本。但总的来说,第三版已经达到了合格标准。如果紧急需要出30秒视频的话,我是愿意用GPT6来做的,提示语我也放在这了。

## AI剪辑提示语

你是一名短视频剪辑师。请根据我提供的 A-roll(人物口播)、B-roll(录屏、图片、视频)和剪辑文档,直接制作一版 9:16、1080×1920 的竖版视频,交付可播放的成片。

这条视频要让观众理解:

【填写一个核心观点】

素材与文档:

【填写路径或链接】

请按以下要求完成:

先理解内容,再安排素材。

看完剪辑文档,检查所有素材,建立“口播—对应素材—视觉处理”的时间线。优先遵守文档里的素材对应关系,尤其是开头。素材按表达需要使用,不必全部塞进去。涉及人物观点或外部案例时,查证原始出处。

人物在下、素材在上作为默认排版,随内容调整。

展示操作和证据时用分屏;强调观点、情绪和结论时,可以切人物全屏。录屏要裁掉无关区域、放大关键操作,并给观众足够的阅读时间。需要比较时,先左右展示,再进入局部细节。

人物独占画面时,也要有剪辑设计。

根据语义和重音加入轻推近、拉远、景别切换或关键词动画。让数字分拍出现、流程逐步展开、想法被删除或积累。避免长时间原片直放,也避免每句话都加特效。镜头移动要照顾人物位置,不裁掉脸部和重要手势。

字幕负责说清口播,动画负责补充理解。

不要在字幕之外,再放一大段同义说明。额外文字优先用于标记阶段、指出差异、说明关系或标注来源。保持字体、颜色、边框风格一致,避开人脸、字幕和平台按钮区域。

保证素材真实、声音清楚。

使用最高质量原片,保留自然口播;剪掉重说、无效停顿和明显口误。不要把示意动画包装成真实操作,也不要把个人感受包装成实测结果。

先自查,再交付。

检查开头是否用了正确素材、录屏在手机尺寸下是否可读、人物段是否有节奏变化、说明文字是否重复字幕、动画是否遮挡、音画是否同步。导出后做完整解码检查,并抽查关键画面。交付成片、时间线和可继续修改的工程或脚本。

你可以使用适合的剪辑工具和 Skill。请实际执行所用工具的工作流,简要说明用了什么、完成了什么;存在素材缺失或无法完成的部分时,如实说明。

最后的最后,我终于想起来做PPT了。

我想没有比这更适合的场景了,把我上上周去交个朋友那里分享的PPT用CodeX二次美化一下。

因为形式的限制,当时不能走纯图片生成,也不能做成HTML再转成 PPT,背景图片还要保留。我当时是让GPT 5.6根据我给的大纲去做排版和优化。

大家可以看到,有些排版其实还是出现了GPT做HTML PPT时候遇到的常见问题,内容整体缩在一个角落,不是平铺在整个PPT页上。讲道理,我觉得这其实没有学到人类做PPT的精髓。如果让我来做一个三列的画面,我肯定会保证它们横纵都是居中的,间距相等,文字也会尽量放在整体画面的中间。但GPT 5.6就更倾向于把它们堆在左上角或者左下角。

gpt6改出来的第一版我有点没绷住,太拉了。

后来我跟它明确说清楚了需求,首先,背景和字体是不能改的,因为这是模板的规范。在这个基础上,我们需要调整的是排版不要全部堆在一个角落,不要用太多颜色跟背景颜色还二次重叠了看不清。

我只能说这个版本,如果它是用HTML做的话只有 4 分(满分 10 分),但如果它是一个纯粹的PPTX,GPT6用电脑控制做的,而且限定了背景和字体样式的话,我能给到6到7分。

可以看到GPT为了兼容背景颜色非常多的情况,采用的是黑色蒙版加白色字分不同大小的结合。我觉得它还是有以前版本遗留下来的毛病,就是很喜欢加特别多的文字。不过比起之前的5.6做出来的 PPT,它已经有了一定进步。

最后的最后的追后,肯定是要回答一个终极问题,这一次GPT-6的UI超过Claude了吗?

很遗憾,我的答案是暂时还没有但是近了一步。

在都没有用任何skill的情况下,这是GPT-6做的skill合集网页,单图放大转到详情页的动效很丝滑但是给我多余配了三个skill封面大丑图,详情页里面说了一堆废话。

这个是Claude做的,大家可以看出来,从设计语言的角度上看,claude不管是从里面的内容,整体风格的表达,还是封面,都比 GPT 做得好。

特别是它给我解决了一个问题。

因为我们之前主要是把多个case融合做成单个 skill,所以把热度最高最好的case作为整个 skill 的主封面。但站在全局视角下会导致一个问题,如果你在案例库里看到这个case的封面,过一段时间又在skill库里看到这个skill用了同一个素材,会让人稍微有点迷惑。

所以Claude Fable 5.1这次封面采取了新的设计,在可选状态下会用三张图合并展示,这样能保证用高热度的case 作为代表作,又通过图片语言表达出这是一个合集。

Anyway,反正写到这里的时候,我的Codex额度也被烧得差不多了。

我真的很希望Tibo周末睡觉的时候,不小心拿出他的GPT额度重置硬件,又不小心按了四五六七八次,然后不小心让奥特曼打开了codex重置卡可以累积的机制,接着我就不小心囤到了100张Codex重置卡。

如果真是这样的话,GPT6你放心吧,我连Claude Fable 5.1都不会多看一眼的。

本文由人人都是产品经理作者【卡尔的AI沃茨】,微信公众号:【卡尔的AI沃茨】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!