实测豆包新模型2.1-pro,这次审美和长时间Agent任务都追上第一档了

0 评论 109 浏览 0 收藏 22 分钟

火山方舟把 Seed 模型升到 Doubao-Seed-2.1-pro-0915,1M 上下文配 256k 深度思考,主打 Agent 长时间执行不摆烂。作者用五个真实文件连测,体素樱花岛一次成稿,视觉和手感都上了第一档。

火山方舟最近给Seed模型推了一次大的版本升级。

Doubao-Seed-2.1-pro-0915,直接顶到了1M上下文和256k的深度思考,主打一个Agent长时间执行任务防中途摆烂,还降低了工具幻觉,还能拿视觉理解去搞前端Coding。

Image

新模型可以来一大轮实测,这次我定的测评case很直接。

不拿玩具样例试水,把手里几个一直拖着没开工的真实文件整份甩进去。中途不帮它拆步骤,不中途追喂提示,就看这个新的豆包模型能不能稳稳接住我。

一共五个case,我分两批聊。

从审美与手感开始,看它是怎么完成视觉设计,空间坐标和交互工程的。再到如果问题长了,工作里面,他的稳定度和严谨够不够,有文档,有表格,看它能不能在百万上下文保持持久记忆。

从3D和前端这几个常用常新case开始,

我直接在goodcase里面随机给seed-evolving一套日式浮空小岛的设计概念,让它用前端一个文件完整复现,而且要能转起来。

Image

用代码还原 3D 设计时,最容易翻车的地方,通常就是材质太硬,打光很乱,比例也不协调。所以这次我把要求尽量写细一点,还是从Goodcase上get的提示语,

请参考所给设计概念,使用Three.js在单一HTML页面中构建一座3D体素风格的浮空樱花岛。要求具备以下要素:

 

1. 立体体素风格的浮空基岩,石阶,绿地与石灯笼,中央矗立一株粉白相间的体素樱花树,树干沿路径递归生长,枝干由粗到细;

2. 完整的轨道控制器,支持鼠标自由拖拽旋转,视角漫游与滚轮缩放;

3. 动态落樱花瓣粒子系统,花瓣在空中自然翻转飘落;

4. 柔和的环境光照与阴影层次,配合暖色调径向渐变背景与指数雾;

5. 环境细节包含远处体素山,岸边泡沫,飘落的雾气与缓速漂移的体素云。

 

体素请使用InstancedMesh实例化渲染,纹理与噪声要求程序化生成,不依赖外部贴图文件。

这是我这次跑起来最快的任务了,但也是27分钟。。

整个樱花树,一点开直接出现,岛上还有断裂的石柱,垂下来的藤蔓,水潭边泛起的泡沫。

远处是山和几条流动的瀑布。天上有飘落的花瓣。。。

视觉是真心很舒服。

然后拖拽,旋转,滚轮缩放也都有了,跟原版的单影片比,简直是降维打击。

之前的可以zoomin 但out不出来。。

光影投在不同角度的体素面上,层次是够的。把一张从设计概念里的氛围图,到真的1比1复刻,我是真的很爱了。。

而且把Seed-2.1-pro用在做3D白模视频搭建,然后用seedance2.5生成AI视频的工作流也是相当丝滑,直接在一个豆包里就全干完了。

Image

然后,就到网站复刻了,

Image

前几天在X刷到的,是真的太萌了。

请开发一个名为The Dumpling Club的沉浸式3D互动体验网页。功能要求包括:

 

1. 竹制蒸笼及小笼包的3D场景,配有酱油碟等佐料容器,并支持切换瓷盘摆盘;

2. 可交互的筷子工具,支持夹起小笼包,浸入酱油碟轻蘸,以及咬开查看剖面,包子在受力时产生形变;

3. 蒸笼上方半透明水蒸气粒子的上升与消散特效;

4. 配合动作的真实音效,包含夹取,蘸料与咀嚼;

5. 模块化代码结构,至少拆分为场景,包子几何体,进食表演,蒸笼,酱油碗,筷子,蒸汽,音频,纹理与录制等独立模块,不使用单一巨型文件;

6. 内置录制功能,以独立渲染器按固定帧率将一次完整的品尝过程导出为视频文件,优先输出MP4,不支持时回退WebM;

7. 支持键盘全流程操作,并适配系统的减弱动态效果设置。

先浅浅地吐槽一下,这个用时是真的久。后面忘截屏,但总共两个多小时。。。

Image

在视觉上,它跟我心目中的原版设计不能说有区别,几乎是完全一模一样。再加上,还是我只给他prompt,还没有参考图的情况下。

而且它做出来的东西,

比我原本想的要灵动得多。

蒸笼里这几只小包子,它居然给每一只都起了名字,还配了完全不同的性格和微表情。有叫Bao的软萌包,有叫Mochi的发呆包,还有Wonton,Peanut和Ginger。鼠标放上去不仅会显示它们的名字和性格标签,小包子还会眨眼,呼吸,甚至偷偷拿余光瞅旁边的同伴。

Image

底下的控制栏也把玩乐属性拉满了。3只,5只,8只小笼包之间切换份数。吃完了意犹未尽,点一下Refill就能重新续上一笼热气腾腾的新包子。

要是点一下那个Boing按钮,整笼小家伙还会齐刷刷欢脱地原地弹跳,解压得不行。

但整套体验里最让我意外,也最戳我的一点,是它在工具栏里自己做了一个Record a bite的录制功能。

点一下这个按钮,它会自动接管镜头,选一只包子,把夹取,轻蘸,咬开品尝的整套动作一气呵成录下来,直接在浏览器里渲染生成一段高清视频,存到本地供你分享给朋友。

经常捣鼓前端或者3D交互的朋友应该知道这有多难。把浏览器里的3D动态无痛录成视频并导出来,我之前用手写代码的方式试过好多次,几乎从来没一次成功跑顺过,经常卡在各种编码支持和帧率丢失上。结果这次新模型不仅自己想到了要给用户做分享功能,还一次性把它跑得丝滑顺畅。

Seed-2.1-pro交出来的直接就是一个充满情绪价值,有完整交互,能让人乐呵呵玩上好一阵子的捏捏玩具。

搞完效果回归工作,现在测模型的数据分析直接放表格难度已经不够高了,

所以我就在想,OpenAI有一段时间不是做了一个数据集,收集了各行各业的真实任务去测GPT嘛。

Image

那是不是也可以复刻一下,从不同的行业里面找真实的数据去给这些模型跑。这样的话就能够准确地看出来模型在行业任务中的真实表现。

我这有几份不同品牌的洗衣机产品说明文档,每个文档厚薄不一,排版不同。每次懒得读但关键参数有的写在正文大段描述里,还有些藏在规格表的小字里,有些甚至混在宣传文案的边角。。。

以前做这种电商选品对比非常耗心力,得一边翻文档,一边自己拉表格,把每台机器的细节和价格一个个抠出来,稍微看花眼就会把波轮和滚筒的参数填混。

Image
Image
Image
Image

我把这五份原始文档一股脑全丢给Seed-2.1-pro,提示语用的这个,

阅读这5份洗衣机产品文档,逐一提取:

洗涤容量、产品类型、能效等级、机身尺寸、核心技术;适用人群与使用场景;官方指导价格。

将结果按统一格式填写到「选货汇总表.xlsx」,字段为:产品名称、核心参数、适用场景、指导价格。

同时输出一份结构清晰的产品摘要文档。所有内容必须基于原始资料,不得猜测或杜撰参数。

文档一出,他根据我不同的情况,给了很多不同的理由。

Image

但其实如果这样,那效果其实也就一般。

让我比较意外的是,Seed-2.1-pro在Excel表格里,不止帮我们根据我们要的形式把内容找了,还把展示图也一张张抠下来了。

Image

原本的文档,图片就是一个很正常的PNG。

想要适当的裁剪,模型本身真的得完全的看懂图。

之前也不是没让AI帮我写过表格,但能帮我把图片整出来的也是挺有用的。。。

然后就跟着这个,我继续来看看做Excel上限到底在哪里

如果你在工程或者制造部门待过,这种文件应该不陌生。一个工作簿点开,里面从Sheet1一路排到Sheet61,每个子表对应一个独立的预制构件。子表里记的是构件分区,新构件编号,楼层部位,混凝土体积,还有主向承载筋啥的好多好多。

Image
Image

我们要的东西是把每个子表的核心字段抽出来,把各项钢筋重量加总,再除以混凝土体积,算出每立方米混凝土的含钢量指标,统一填进一张汇总表。

这个活本身不难,但真的是又长又麻烦。。

以前让模型处理这种多步骤流程特别是独立的Excel,经常读到第二十个表就开始丢字段,或者算到后面漏掉关键数字。

你还得自己回去一个一个对。。。。那更是不可能。

我把原文件整本丢给它,让它自动走完全部子表的提取和指标计算。

处理该Excel文件,检查60个明细表,提取每张表的钢筋总重量和混凝土体积,并正确匹配、填写到Summary对应行。

保留所有原始工作表、数据和格式;不要猜测缺失值。完成后验证Summary与源表一致,并返回可编辑的Excel文件。

同时报告,处理表数量,无法识别的表,以及最终文件是否成功重新打开检查。

一把一次过了直接是真的没想到了

而且结果比我预期干净。汇总表交出来60行,序号,构件分区,子表等等等所有要的提到的计算它要啥有啥。

为了不犯错我还随机抽了几个表,纯手工核了一遍数字。

还有个我下的套。

原文件里子表编号排到Sheet61,中间独独缺了一个Sheet11。。。seed-evolving没有自作主张补一个,也没有把这个空号算进汇总行数,最后交给我的就是干干净净的60行。

Image

再来再来,

既然做表格可以,那我让Seed-2.1-pro也来做调研跟资讯看看。

前阵子有个在温哥华的朋友找我,想给团队物色办公室,让我在加拿大帮他做个选址对比。

说实话,刚接这个事时我头皮都是发麻的。做过这种调研的朋友都知道有多折磨人。特别是现在做AI,你得摸各个城市的科技人才密度,不同梯队的工程师薪资水准,核心区写字楼实际租金。。。真要自己一页页搜,小半周时间直接就搭进去了,费时费力还不一定摸得全。再再再加上我是真一点不懂啊。。

以前扔给模型,产出来的基本全是温哥华气候宜人适合生活,多伦多商业成熟,蒙特利尔AI学术底蕴深厚这种的废话。结论挑不出毛病,但真拿去当建议,谁敢拿这种大而化之的空话去做几百万的决定啊。。

但我索性把任务连带背景直接甩给了Seed-2.1-pro,纯就想着看看它的上限回答

调研温哥华、多伦多和蒙特利尔,推荐最适合设立小型 AI 工程办公室的城市。

比较:软件人才、薪资水平、办公成本、AI 生态、大学招聘资源、相关优惠政策及主要风险,并使用近期可靠来源。

交付:

Excel 对比表, 2 页推荐备忘录, 来源附录。

所有重要数字必须可追溯到具体来源。

顺着它给的数据一条条去翻,从核心写字楼每平方英尺的净租金,到资深工程师的薪资分位数,所有关键点背后全都能找到真实的数据源。所有东西都是真的有用,而且是真正拿来当决策依据的。

Image

它的最终建议是多伦多。

而且给出来的理由极硬。多伦多科技人才储备有33.4万人,是温哥华的2.7倍。2021到2024这三年,当地硬生生净增了42900个科技岗位,全北美排第二。在CBRE的科技人才综合评分里多伦多排第3(得分72.73),而温哥华排第9,蒙特利尔排第11。

交上来的工作簿里整整建了五个表页。第一页是三座城市的横向PK大矩阵,然后第二页针对500人规模的企业又拉个年度办公加人力开支模型,最后第三页还很贴心地按20人小团队算了首年场地租金。。。

那个500人模型算出来的数字特别有意思,温哥华每年要4168万美元,多伦多4137万,蒙特利尔3749万。多伦多居然比温哥华还要省一点,这结论一下子打破了很多人觉得多伦多一定更贵的固有印象。

Image
Image

然后最重要的就是后面附上的来源附录整整排了31条。。。每一条都清清楚楚写着发布机构,报告原名,精确链接和访问日期。从加拿大联邦Job Bank的薪酬数据,再到到Mila的报告,各个案例研究,甚至连魁省96号法案的合规条款全都有据可查。。。

就凭这一份交付,不管是转给我那个温哥华朋友,还是拉着团队直接开会拍板,我感觉我都行了这次。

说到最后,插一句我最近刚学到的小方法,

正好治AI说空话这个病,QBS法。

以前问AI怎么办,它回你的全是温哥华气候宜人适合生活,多伦多商业成熟这种正确的废话,道理都对,就是没法拿去拍板。

QBS的思路特别朴素。AI说空话,是因为它没啃过正经书,那就先给它一本,让它按书里沉淀了几十年的方法干活。

就四步。

Image

然后把PDF丢给任意Agent,豆包工作啥的,用book-to-skill转成一个skill。最后让AI调用这个skill来回答你的问题。

核心就一条,这个skill必须跟书对得上,书里怎么讲的,AI就得怎么答。

这一招跟我上面这个选址case是同一套思路。

别让AI空口说白话,要么给它可追溯的数据源,要么给它一本真书。

至少会跟着书的思路,能少点假大空。

总的来说,Seed-2.1-pro会成为我日常批量跑的模型之一,跟glm,deepseek排排队一起干活。

有一说一,豆包最近更新是频率是真的高,豆包工作,还有昨天上的能进各种群聊的工作伙伴,现在又丢出来一个Seed-2.1-pro。Agent和模型都追上来了,再加上飞书那条线数据管理啥的也包圆了,感觉再过一段时间就啥都不缺了。

作者 / 卡尔 & yc星辰

本文由人人都是产品经理作者【卡尔的AI沃茨】,微信公众号:【卡尔的AI沃茨】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!