Seed-2.1-pro悄悄变强,多模态Coding能力我爱了。

0 评论 127 浏览 0 收藏 44 分钟

Doubao-Seed-2.1-pro更新0915版本后,把重点压在Coding、Agent与多模态三块。作者拿三维艺术馆网页等实际任务试了一圈,看它在长程任务里会不会自己推进,以及视觉理解接进开发后的差别。

Doubao-Seed-2.1-pro 升级了,更新了 0915 版本。

官方介绍,0915 版新模型将重点放在了 Coding、Agent 和多模态三块,尤其是在将视觉理解接入开发和长程任务里有了更大的提升。

这正好也是我最近任务的需要啊。模型在看完图片、视频等素材之后能不能真的把东西做出来,步骤很多的任务它会不会自己一路推进不糊弄,调用工具后它会不会更好地去执行任务,这些都很重要。

三维艺术馆网页

这是我朋友的一个需求,我是在豆包工作里完成的。

她希望可以基于平面图做成一个电子展览的 3D 网页,类似立体效果图一样,更加直观地看到画展作品放到指定位置、增加灯光以后的效果,并且也可以通过鼠标拖拽和快捷键达到在电子展馆中游览查看的目的。

让 Seed-2.1-pro 需要把这个做成一个能点进去观看的电子展馆,难点也不少,草图上的空间关系、作品编号、展签文字,最后都要在同一个画面里对上号。

请根据附件中的展厅平面草图、27 件作品编号总览,以及配套作品资料,制作三维电子展馆。用户应能在浏览器中用鼠标连续参观,看到每幅作品和对应简介。

配套文件夹:/Users/irene/Documents/插件工具合集/测评案例/电子艺术展馆包括作品图片、展位与作品对照、逐件展签与布光、空间布局和单展位布光示意。

使用既有的 01 至 27 编号与三个展区关系,保持平面图、作品、展签和场景一致。

总览图用于辨认和核对,挂墙时使用配套的单件图片。

按以下顺序执行:

1. 先阅读平面图与作品总览,梳理三个展区、入口出口、隔墙、通道、展位和建议动线。再核对配套表格和坐标文件,标明图片与文字之间是否有矛盾。不得跳过看图,直接另建一套展厅。

2. 建立展位清单。逐一匹配编号、作品图片、名称、作者、年代、简介、馆藏页面与布光信息。需要补充或核实的资料从大都会艺术博物馆等对应馆方页面查找,不另换一批作品。没有可靠资料的字段如实标记。

3. 先确认空间与参观方案,再开发。保留平面图中的总体尺度、分区和作品顺序,考虑入口导览、观众行走、转向、观看距离与返回入口。若为可用性调整布局,明确调整理由并同步更新平面图和对照表。

4. 搭建可运行的空间原型。支持鼠标拖动转向、滚轮向前后移动,点击作品打开名称与简介;提供操作提示、复位和展区快捷跳转。控制墙体碰撞、移动速度、镜头高度和转向幅度,让第一次使用的人也能顺利参观。

5. 把 27 件作品图像真正挂入对应展位。保持原始画幅比例与完整内容,避免拉伸、裁掉作品或把整张总览图当成一幅画。立体藏品以原有照片挂墙呈现,不要求凭照片编造其完整三维结构。

6. 按配套布光信息设置数字展厅光照。使作品清楚、展签可读,避免过曝、反光与严重偏色;检查不同展区的整体氛围。若渲染工具无法直接使用某项灯光单位,记录转换或视觉校准方式,不宣称等同于实体展馆照明验证。

7. 制作作品详情卡,包含名称、作者或年代、简短介绍与来源入口。信息较长时合理展开,关闭后保留原参观位置。所有信息按作品编号绑定,不能因排序变化串错展签。

8. 按 01 至 27 实际逐站检查图片、位置、比例、灯光、文字与点击行为。完整走通入口、三个展区和出口,修复穿墙、卡住、图像缺失、作品不可达及文字遮挡。检查不同窗口尺寸下的表现。

9. 交付可运行展馆、源码、启动说明、最终平面图、作品与展位对照、必要的调整记录和实际验收结果。整个过程使用同一套作品编号,资料与场景同步。

验收:两张参考图和作品资料能在实际场景中逐项对应;27 件作品全部入展;鼠标参观与作品详情真实可用;布光和比例经过检查;每件作品的图片、简介与来源匹配。

前端与设计还原以及根据我的要求补充,它看截图之后继续修改等方面,都做得挺好的。

这里对于多模态 Coding 的要求还是比较高的,平面图里的位置关系、作品图片的比例、介绍文档里的编号,都要变成网页中具体的布局和交互。

图文信息提取、元素定位和前端还原能力也都不错。

从通道到展位逛起来很流畅,所有的展品和介绍也是按照平面图和示意图中的序号来安排的,灯光也有好好对应,当然灯光主要是视觉模拟,不能当实体展厅的照度结果。

有几件作品的作者姓名,馆方页面没有,展馆的详情卡上就老老实实显示“佚名(馆方页面未注明作者)”,没有随便乱写一个像模像样的人名进去。下面保留了馆藏来源链接,也都是点击可以准确直达的。

复杂长任务项目

接下来测试 Seed-2.1-pro 的长任务能力,看它能不能把模糊想法推进成完整方案,并在多步骤、多文件之间保持一致。

我的设想是,让毛茸茸的小动物经营一家兵器铺,串起种植、采集、合成、冒险和订单经营,推动店铺与角色成长。武器用农作物和自然材料制作,结合古代兵器的形态,有种可爱荒诞的感觉。

它会先完成世界观和策划,再把策划、数值、开发验收和阶段汇报分别整理成 Word、Excel 和 PPT,校验一致后再做原型。

请从零策划并制作《毛茸茸兵器库》。这是一个以毛茸茸小动物、兵器制作、种植经营和野外冒险为核心的原创游戏项目。游戏中的经营据点是一家兵器铺。请继承下述创作方向,先完成整个游戏的世界观与策划,再推进原型、美术、开发与验收。所有素材由你自行生成或查找,我只提供文字要求。

一、创作初衷与整体体验我想把一个真正有趣的游戏想法从零做成可以玩的东西,同时观察你能否持续推进复杂任务、使用工具解决问题,并让游戏与 Office 策划资料保持一致。游戏要有毛茸茸小动物的可爱、笨拙和喜剧感,也要有研究武器组合、经营自己的小店、外出冒险后带着收获回家的满足感。重点放在“玩武器”:不同武器应改变玩家的操作和战斗体验,经营与种植为这些武器提供材料、用途和成长动力。可以借鉴《猛兽派对》让人容易理解的动物趣味和动作喜剧气质,以及《我的世界》中收集、合成、建造带来的探索感,但角色、美术、地图、界面、叙事和具体玩法必须形成自己的表达。保留经营、种植与冒险的结合,不照搬现成游戏,也不要为了规避相似性而删去原本的趣味。

二、世界观与故事的大方向这是一个由毛茸茸小动物生活的幻想世界。玩家扮演经营兵器铺的小动物,身边有可以种植的土地、制作兵器的工坊,以及能外出探索、采集和战斗的野外区域。这个世界里的农作物和自然材料可以参与兵器制作。武器既有古代兵器的形态与动作启发,也带着日常食物和手工作品的荒诞感。菜地、工坊和野外之间要有合理联系:种植提供材料,冒险带回新资源,制作带来新玩法,经营所得推动店铺和角色成长。整体故事轻松、有幽默感,允许小动物笨拙、失误和闹出笑话。冲突要服务于经营与冒险,不要把它扩写成沉重宏大的战争故事。在这些方向内补全世界的名称、地理与生活规则、玩家的身世与开店原因、主要人物关系、问题的起因、冒险目标和阶段性结局。上述细节尚未确定,由你创作并在策划中明确,不把自行补写的内容称为用户已经确定的设定。

三、必须保留的核心玩法围绕“种植与采集 → 收获材料 → 合成兵器 → 装备与试用 → 外出打怪 → 带回奖励 → 经营和升级 → 解锁新的制作可能”形成完整循环,并支持保存和继续进度。种植的农作物要实际进入配方,采集与打怪所得要实际支持制作和升级。兵器铺需要有合理的订单、出售或其他经营方式,让生产选择与收入发生联系。外出冒险要能检验不同武器的用途,成长要给玩家继续种植、制作和探索的理由。武器的趣味来自实际效果和使用代价。例如南瓜锤能击退敌人,同时把自己弹起来;萝卜长枪可以冲刺,但转向有代价;爆米花弩发射会弹跳的弹丸。把这些作为代表性设计纳入策划,具体参数、配方和表现由你平衡。避免只换造型或名称,实际攻击方式完全相同。古代兵器的丰富形态可以作为继续拓展的灵感。新武器应有清楚的攻击方式、反馈、适用场景及副作用,副作用要让人觉得好玩,同时保持可理解、可操作。

四、美术与视听方向采用短毛绒玩偶与手工微缩工坊的整体风格。角色有柔软、圆润、像玩偶一样的质感,兵器、农作物、建筑和场景形成统一的手工世界。整体可爱、温暖、带一点荒诞感,避免逼真血腥表现。优先采用固定斜俯视镜头,让玩家清楚看到动物动作、菜地、工坊和战斗反馈。通过动作、音效、材质与适度的物理表现传达武器的力度和笑点。保证操作清楚,避免复杂物理效果破坏可玩性。角色、怪物、道具、界面和场景需要先有统一的设计规范,再批量制作素材。画面精细度与玩法完成度分别评价。

五、AI 在项目中的作用使用 AI 辅助世界观与剧情创作、角色和道具设计、武器外观、效果构思、素材制作与代码开发。需要调用外部生成工具时记录工具和实际贡献,不将第三方生成质量全部归为被测模型的能力。“AI 设计武器效果”需要最终落实为游戏中真实可执行、可测试的规则。开发阶段可以用 AI 提出配方、技能和副作用,再实现到代码里。首版无需接入玩家在游戏里任意输入一句话就生成新技能的系统;将这种想法作为后续扩展单独规划,说明需要的约束与成本。所有素材由你自行生成或寻找。可参考 Kenney(https://kenney.nl)、OpenGameArt(https://opengameart.org)和 itch.io(https://itch.io),具体素材自行选择并核对使用条件。不要要求我提供个人照片、工作资料或预制素材。生成工具不可用时,用合适的原创程序图形或简化模型推进,并说明视觉限制。

六、按常规游戏制作流程执行

第一步:完成故事大全景与世界观文档。写清世界运行规则、玩家身份、开店动机、主要矛盾、故事起承转合和阶段性结局,解释动物、农作物、兵器铺与野外冒险之间的关系。让读者能理解这是怎样一个世界,以及玩家为什么愿意留在这里。从此阶段开始建立并维护 Office 文档,完整保存设定。不要先写游戏代码再补故事。

第二步:完成角色、道具、场景和故事细节设定。在世界观基础上,设计主角、重要顾客或伙伴、怪物等角色,说明性格、动机、关系、外观和剧情作用。整理作物、材料、武器和经营设施,明确用途、来源与关联。设计店铺、菜地和野外之间的空间关系,以及承担引导和成长作用的事件、任务、对话与阶段目标。此时完成美术方向、角色与道具规范及关键场景设想。数量由完整构想与首版范围共同决定,不为凑清单制造无用内容。

第三步:完成可交付的游戏策划与 Office 资料。写清操作、核心循环、种植与收获、背包、配方与制作、装备、战斗、订单与收入、奖励、升级、失败恢复、存档和新手引导。明确资源如何产出与消耗,武器之间如何形成选择,玩家如何感知成长。建立以下相互关联的可编辑文件:《世界观与游戏策划.docx》:保存完整故事、角色关系、玩法、流程、美术规范和首版范围。《游戏主数据.xlsx》:保存角色、作物、材料、武器配方、伤害、冷却、副作用、奖励和升级费用等实际采用的数据,用稳定标识关联游戏配置。《开发与验收.xlsx》:保存工作依赖、阶段计划、完成状态、缺陷和实际验证证据。通过验证后才能标记通过。《项目说明与阶段汇报.pptx》:开发前说明世界观、玩法、风格和制作计划,开发中持续加入实际成果,最终说明真实完成度与问题。检查各文件的名称、关系、数值与版本一致,确认核心玩法没有缺口,再进入原型阶段。无法生成规定格式时,提供可编辑替代文件并准确说明差异。

第四步:确定首版范围和技术方案。保留完整游戏规划,同时将首版控制在可以玩通的小体量。此前的原型方向是一名可操作角色、一块菜地、一座锻造炉、一张野外地图、两类怪物,以及南瓜锤、萝卜长枪、爆米花弩等代表性武器,并串联背包、经营、奖励、升级和存档。以此作为首版基线,根据技术可行性调整具体规模并记录理由。首版采用单人体验,联机、开放世界、付费系统和游戏内任意生成技能放入后续规划。自主选择适合当前环境的引擎或技术,不为了技术展示增加无关复杂度。

第五步:制作并验证玩法原型。完成策划后,先用占位素材制作移动、南瓜锤和敌人的小样,实际验证攻击、击退、自身弹跳及受击反馈。通过后接入种植、收获、背包、合成、装备、冒险、经营、升级和保存,玩通核心循环。检查趣味与操作是否成立。发现设计问题先修正规则,同步更新策划和数据,再扩大制作。不要把编译成功或静态页面当作原型通过。

第六步:制作正式素材并完成开发。按既定美术规范自主寻找或生成素材,完成角色、场景、武器、界面、动作、音效与特效。按系统依赖逐步实现并整合,每个阶段保留可运行版本,实际检查后再继续。三种代表性武器应产生真实差异,种植和冒险所得应真正支持制作、经营与成长。效果图中出现但未实现的功能不能计入完成项。运行失败时检查日志、画面与真实状态,修复后再验证。

第七步:持续同步策划,并执行一次跨文件变更检查。需求、名称、规则、配方、数值或范围变更后,同步更新受影响的游戏配置、界面、文档、表格和演示文稿。建立明确的数据维护方式,避免互相矛盾的多份手工记录。首版完成后,对一件已实现武器的配方和冷却作一次受控调整。可以采用此前讨论的测试:南瓜锤配方中的南瓜数量增加 1,冷却增加 0.5 秒。先保留修改前版本,再检查并更新所有实际受影响的位置。运行游戏验证材料扣除和冷却确实变化;检查表格公式和文件内容;打开或渲染文档、表格与演示文稿,检查可读性和排版。保存变更清单与证据。

第八步:完成试玩、修复与交付。从新玩家视角实际跑通种植、收获、制作、装备、打怪、返回、经营、升级、保存和重新进入。重点检查材料不足、重复点击、死亡或失败恢复、背包变化、奖励结算、冷却与读档。修复影响核心体验的问题并再次验证,核对所有 Office 资料与最终游戏一致。自主推进常规阶段,遇到真正无法继续的工具或权限问题时,说明具体阻塞及已完成部分。交付可运行游戏、源码、启动与操作说明、完整 Office 资料、素材及使用条件记录、试玩截图或录屏、验收记录和已知问题。记录模型、工具环境、实际耗时、人工介入次数和外部工具贡献,明确完成、失败与尚未验证的内容。

七、最终验收世界观、人物、道具和故事形成连贯设定,经营与冒险在其中有合理位置。策划与 Office 资料在开发前建立,之后随项目持续维护。玩家能够玩通完整循环,三种代表性武器有实际不同的效果和代价,毛茸茸动物与荒诞兵器的趣味得到保留。资源扣除、奖励、成长与存档行为正确,配方和冷却变更在游戏及相关文件中一致。交付物能够打开和运行,所有通过结论有真实检查证据;视觉质量、游戏完成度、Agent 持续执行能力和 Office 一致性分别记录。

八、两项大任务与统一项目文件夹本案例包含两个必须同时交付的大任务:A,完成游戏策划与可运行游戏;B,从策划阶段开始维护与游戏一致的资料和报告三件套。两项工作共同构成一次完整交付,不能只完成其中一项。建立一个名为“毛茸茸兵器库”的项目总文件夹,将游戏工程、运行版本、素材、全部策划资料、表格、报告和验证记录归入其中。可以设置清楚的子文件夹,在根目录提供总览与文件索引,说明每份文件的用途、当前版本和启动或查看方式。既有文件名称保持一致,避免另起多个相互矛盾的版本。必须包含前文全部交付物:《世界观与游戏策划.docx》《游戏主数据.xlsx》《开发与验收.xlsx》《项目说明与阶段汇报.pptx》,以及源码、启动与操作说明、素材来源、试玩记录、变更清单和已知问题。另增加《游戏项目摘要.docx》《三件套一致性核验.xlsx》,保留数据同步所用脚本、配置或可复用流程。

九、报告三件套的制作与同源同步将原先报告三件套的做法落到游戏项目中,不引入无关行业报告。三件套由《游戏主数据.xlsx》《项目说明与阶段汇报.pptx》和《游戏项目摘要.docx》组成;完整策划文档与开发验收表继续维护。

1. 开发前,整理游戏中实际需要的关键数据组,覆盖配方与材料、武器效果、经济与成长、制作范围和阶段计划。用《游戏主数据.xlsx》作为相关数值的统一来源,区分策划假设、公式计算和实际测试数据。涉及计算的内容使用公式,注明单位、版本和依据,不伪造用户测试与经营业绩。

2. 用同一来源生成约 12 至 15 页的项目演示文稿及一页项目摘要。演示文稿包含目录、故事与玩法、角色与美术方向、数值与经济图表、制作计划及当前状态,并具备一致的页脚与日期。开发前使用已完成策划内容,开发后加入真实游戏截图、验证结果和已知问题。摘要与演示文稿都能回溯到主表或策划中的对应位置。

3. 建立数据字段到游戏配置、界面、策划正文、摘要、演示文稿文字及图表的对应关系。可以用自动引用或可重复执行的更新流程实现,不要求不同 Office 软件之间天然实时联动,但必须实际完成一次端到端同步。

4. 使用前文的武器配方与冷却变更执行一致性测试,沿同一来源更新所有依赖。若演示文稿或摘要尚未提及被修改指标,在首版报告中纳入该指标和相关图表,再进行测试。检查派生计算、图表标签、正文、摘要与游戏行为;目录、页码、版本和页脚日期也应与最终版本相符。

5. 在当前交付版本中检查与目标字段有关的旧值残留。历史快照和明确标记的变更前后对照允许保留旧值,无关字段中的相同数字不能误删。列出修改前值、修改后值、涉及文件和核验结果。

6. 重新计算表格公式并打开检查;将演示文稿逐页导出预览并回读,核对图表与主表数据、目录页码、文字溢出、遮挡和排版;检查 Word 摘要与完整策划。把逐页和逐文件核验写入《三件套一致性核验.xlsx》,修复后再次核验。

7. 最终在同一个项目文件夹交付全部可编辑文件和一致性证据。分别汇报游戏是否可玩、策划是否完整、三件套是否同源、改数是否同步、文件是否通过实际查看。只完成游戏画面不能代替资料同步验收。

接下来是它执行的结果。

阶段汇报是 15 页 PPT。过程中通过对话可以完成所有本地文档的增删修改和同步。对这种项目,策划、数值和汇报需要一起动,改了一个设定,其他文件也要同步,它做得也挺好的。

多轮修改、全局一致。准备好的资料和验收表里后续待完成的工作也分得清楚。

一切准备就绪,让它再往下推进做游戏。

白模参考视频

之前和朋友也聊过,3D 导演台和白模运镜参考对生成 AI 视频都挺有帮助的,但是对于没有接触过 3D 模型工具的朋友来说,这个做白模和运镜的过程也够呛。这回试试能不能直接叫模型自己生成白模参考视频。

当 Agent 可以接管 Blender,那可玩性就强了很多了。

比如我之前想参考马戏之王那种感觉,做一段两人弹跳的动作,并且运镜也比较复杂的,要做出来那种感觉很难描述。

0–4s 进场环顾 ,4–9s 男主角弹跳翻,9–14s 女主角弹跳翻,14–20s 双人齐弹齐翻 + 升起拉远。

直接用视频模型生成,角色位置、动作和镜头运动很容易各走各的,改一次下次走位又两模两样了。

【素材映射】@白模参考视频:运镜、景别、双人走位、弹跳/翻腾/落地节奏的唯一时间轴依据,必须严格跟随,禁止自行改运镜路径。@男演员四视图:马戏男演员外观锁定(瘦高成年男性),面孔、发型、服装、鞋履以四视图为准。@女演员四视图:马戏女演员外观锁定(成年女性),面孔、发型、服装、鞋履以四视图为准。@马戏场景:马戏之王气质马戏棚空镜,金红帷幕、舞台追光、金色尘雾、两侧高台、绳索秋千、中央大型圆形弹跳床。

【一句话概述】马戏之王风格空中马戏短片,双人杂技弹跳翻腾,电影感写实,20秒,16:9,720P,严格跟随白模参考视频的镜头与动作节奏。

【全局设定】将白模几何角色真实化为真人马戏演员:白模红球=男演员,白模蓝柱=女演员。服装不要做成纯红/纯蓝紧身衣,以四视图为准。两人始终同框。场景只能是马戏棚+弹跳床+高台,禁止现代城市、禁止额外观众抢戏。动作:助跑、弹跳床弹起、空中干净空翻(转体在腾空最高段完成),落地只缓冲,不穿地、不沉地板、落地后不补拧。运镜保留白模中的变化:极端仰拍、大广角建立、荷兰角跟拍、环绕翻腾、英雄特写、升起拉远收尾。写实电影质感,舞台追光,金色尘雾。可生成环境音与低频马戏弦乐;无字幕,无水印。

【时间轴】严格对齐@白模参考视频时间节奏(约20秒):进场→男演员高台/弹跳翻腾→女演员高台/弹跳翻腾→双人齐弹齐翻→特写与升起拉远收束。

【全局收束】面孔与服装锁定四视图;镜头与走位锁定白模参考视频;禁止穿模、禁止沉地板、禁止单人长时间出画、禁止忽略参考视频自由运镜。

这里也能看到其 VLM Agent 把视觉理解接入实际操作的能力。它需要结合画面中的角色位置、遮挡关系和动作衔接判断问题,再调用工具修改场景,让视觉判断推动下一步操作。

3D 空间构图、场景布局和运镜速度,在白模阶段就被固定了下来,可以逐帧检查白模效果,改完再交给生成。角色站在哪里、镜头从哪里经过、动作之间怎么衔接,也都需要在 Blender 场景里落实。

Seed-2.1-pro 负责组织预演并调用工具,后续我再用 Seedance 参考预演视频生成最终画面。

对做视频的人来说,这比在提示词里反复描述镜头怎么环绕怎么上升然后反复抽卡靠谱和划算得多。

科普视频

前几天在央视新闻看到一个非常有趣的短片,当时有位航天员在空间站里演示把毛巾拧湿,水却没有滴落,感觉这个很适合做简单的科普视频。

继续让 Seed-2.1-pro 完成这个任务。我让它从相关网站查找关于这个实验和解说的相关资料,制定短片方案,准备相关素材,完成旁白、分镜、字幕等;最终自己剪辑和合成,给我产出一个科普视频。

Seed-2.1-pro 的执行流程从资料核对到脚本分镜,再到调用图片和视频模型完成出图、动态和配音,收尾用 FFmpeg 剪辑合成。 这里也可以考验一下他们的全过程交付能力。

请围绕近期中国空间站“拧湿毛巾时,水没有像地面上一样滴落”的实验,制作一条普通人能看懂的科普短片。以附件实验视频为起点,核实事实,规划短片并完成实际制作。需要的补充图解、文案和配音由你准备。

资料从央视网、央视频、中国载人航天工程网和新华网查找。只给出网站范围,具体报道、素材与制作工具由你选择。

按以下顺序执行:

1. 先确认事件。核实近期中国空间站实验的发生日期、视频发布日期、原始发布方与画面内容,区分旧视频重新传播和新实验,不把其他国家或其他年份的演示混用为同一次事件。找不到对应近期视频时如实说明,并继续完成能够独立推进的部分。

2. 在看过视频并理解可靠解释之后制定短片方案。确定面向谁、需要解答的核心问题、叙事顺序、适合的时长和表现方式。讲清观察到的现象与背后的原因,避免把微重力环境说成完全不存在引力。

3. 检查素材是否适合当前用途,再准备视频、图解、配音和其他必要材料。原片的使用条件不明确时,用原创图解或动画呈现原理,并标注为示意;保持真实实验来源可查,不把生成画面当作现场录像。

4. 先完成旁白、分镜和字幕文稿,检查每个镜头承担的解释任务、所依赖的事实和实际可获得的素材。文稿成立且材料可用后,再进入剪辑与合成。

5. 使用可用工具完成实际制作。画面、配音、字幕和解释要同步;文字可读,叙事连贯,引用与原创示意的身份明确。根据表达需要确定成片规格,不为增加效果而堆叠无关素材。

6. 每次生成、剪辑或导出后等待真实结果,检查返回文件。出现失败、空文件、素材缺失或工具不可用时,说明具体问题并采用可行替代方案。不要把任务已提交、脚本已写好或导出命令已运行等同于成片完成。

7. 播放最终文件,检查画面、字幕、音频、科学解释和片尾来源。修复黑屏、错字、声画不同步与事实错误,再回看修复结果。

8. 交付可播放成片、文稿、字幕、可编辑工程或制作文件、来源与使用条件记录,以及实际验证结果。未能完成的视频环节应明确列出,已有文件照常交付。

视频拉片

这个案例也是在豆包工作完成的。我给了它韦斯安德森导演的广告《Castello Cavalcanti》,让它做全片拉片。并且要求它截取带有时间码的关键帧、逐镜记录起止时间、转场、景别、动作、运镜和叙事作用等等。

要求细一点更容易看出它有没有真正拉明白。人物在移动和摄影机在移动,能不能分清、镜头切换找得准不准、对叙事作用的分析,在画面里有没有依据等等,这些都可以和原片逐条核对。

出来的是一个带有 6 个子表的 Excel,22 个镜头,106 张关键帧。视频理解和 Office 交付都有涉及,镜头分析有时间码和画面作为依据,后续都能回到原片找到对应位置。 这样的拉片结果会很方便后续复用。

请对该视频完成全片拉片,整理成逐镜头可核查的影像分析档案。重点测评视频时间线理解、镜头识别、构图与叙事分析,以及依据画面重建图片和视频提示词的能力。

使用本文所附电影作为统一分析素材,直接分析原片。

按以下顺序执行:

1. 检查素材并制定方案。确认附件可以播放,核对实际时长、音轨可用性和分析范围。完整观看原片,确定分析方法与交付结构。片名、简介、字幕和既有影评只能辅助,不能替代观看;先独立记录画面,再使用外部资料核对背景。

2. 建立完整时间线。先概括全片结构,再切分所有镜头,包含片头与片尾并标记其类型。记录镜头编号、开始时间、结束时间、时长和转场。镜头内摇移、人物进出、变焦或字幕变化不能自动算作切镜;叠化边界不确定时保留过渡区间,说明计时口径,避免重计、漏段和负时长。受工具限制时分段分析,再按原片时间合并并复核段落交界。

3. 逐镜头提取证据。记录主体、环境、人物位置、可见动作与动作发展、摄影机运动、景别及其变化、构图、光线、色彩和景深。每个镜头至少保留一张带时间码的真实关键帧;涉及连续动作或运镜时补充起止帧及必要中间帧,不能凭单帧判断运动方向。

4. 分析镜头的作用。结合前后镜头解释这个景别如何交代空间、突出信息、表现人物关系或情绪,以及人物调度、构图、色彩和剪辑如何推动叙事。每条解释指向具体时间与可见证据,避免反复套用“营造氛围”等空泛句子。将画面事实与创作意图推测分开。焦距、器材和导演真实意图无法直接确认时标为未知或推测。

5. 识别画面文字与声音信息。整理实际可辨认的标题、字幕、招牌等,记录原文、时间、位置及不确定字符;翻译与原文分列。口播转写与画面文字分别记录,不把自动字幕当作 OCR 证据。声音分析以实际读取音轨为前提,未处理音频时明确说明,不能猜测对白或配乐。

6. 为每个叙事镜头反推两类完整中文提示词。图片提示词对应代表帧,包含主体、服装、环境、机位、景别、构图、光线、色彩与材质;视频提示词对应连续镜头,包含起始状态、动作顺序、镜头运动、节奏与结束状态。使用具体视觉描述,不只写导演名字或“电影感”。同一角色与场景的描述保持一致,每条自包含,不用“同上”省略。统一标注“基于画面重建的提示词”,不宣称获得创作者原始提示词。片头片尾等非叙事条目可以标记不适用并说明理由。

7. 制作可下载的 .xlsx 表格。至少包含完整拉片表、图片提示词、视频提示词、全片分析、画面文字五张工作表。完整表一行一镜头,包含上述字段、关键帧、证据和不确定项;缩略图真实嵌入并与时间码对应。设置冻结表头、筛选、自动换行和合理列宽,提示词全文不得截断。另交付带时间索引的分析报告、关键帧联系表和结构化 JSON;可用工具支持时提供点击时间码回看原片的索引页。

8. 回看与验收。复查镜头边界、连续运镜、遮挡、小字和段落交界,核对时长合计及覆盖范围。实际打开导出表格,检查图片、字段、提示词全文与原片对应关系。修正后记录问题和仍待确认的内容;模型自检不能冒充独立人工准确率。最终将来源、素材规格、完整结果与核验记录归入同一任务文件夹。

验收:全片覆盖范围清楚,时间线完整;每项分析可回到原片核对;景别、构图、氛围及叙事作用有具体依据;两类提示词对应各自镜头;观察、推测和未知明确区分;Excel 可下载并正常打开。

小结

这轮用下来我发现,Seed-2.1-pro 的视觉理解和实际 Coding 和 Agent 执行提升了很多。

另外新版本对复杂代码仓库的结构、模块关系和跨文件问题理解更好了,从需求理解、代码修改到运行验证的端到端开发能力也有提升。已有项目推进、持续修改和修复问题等都可以。

火山方舟已经可以调用这个新模型的 API 了,认准0915,另外豆包工作和 TRAE 也能直接调用了。 感兴趣的朋友可以自己去试试,尤其是那些需要看图再动手或者多步骤的任务,体感会比较明显。

本文由人人都是产品经理作者【阿真Irene】,微信公众号:【阿真Irene】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自作者提供

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!