Grok Imagine Video 1.5 上线,多镜头衔接更连贯
Grok 官方宣布 Imagine Video 1.5 agent 上线,基于最新的 Image 2.0 模型,视频质量更高,智能体叙事能力更强,擅长将多个镜头连接起来并保持更好的连续性。
为什么值得看:官方发布,视频生成质量提升,多镜头衔接更连贯,做短剧和视觉叙事的可以实测看连续性表现。
8 月 31 日 — 9 月 6 日
从本周日报中按创作价值与信息完整度筛选,保留可直接试用、复现或拆解的内容。
Grok 官方宣布 Imagine Video 1.5 agent 上线,基于最新的 Image 2.0 模型,视频质量更高,智能体叙事能力更强,擅长将多个镜头连接起来并保持更好的连续性。
为什么值得看:官方发布,视频生成质量提升,多镜头衔接更连贯,做短剧和视觉叙事的可以实测看连续性表现。
Runway 推出面向小企业和团队的 Team Plan 自助套餐,支持 2-9 个席位共享一个额度池,包含共享项目、评论、Agent skills 和 Agent Connectors,方便团队在一个地方协作构建。
为什么值得看:做 AI 短剧或工作室的制片可以看看,2-9 人共享额度、项目协作和 Agent 连接器,适合小团队统一管理制作预算和素材。
Krea AI 官方宣布已构建面向创意工作的智能体,Beta 于发布当天开启,用户可通过评论或转发获取早期访问资格。官方称其为「世界最好的创意工作智能体」,但未透露具体功能细节、模型能力或接入方式。
为什么值得看:做视觉和整合的可以蹲一下,Krea 把智能体押在创意工作流上,评论转发能拿早期访问资格,想试的现在就能去抢。
Google 官方发布 Gemini 3.8 Flash,定位为处理复杂 Agent 与多步任务的模型,官方称其为最智能的「工作马」模型,推理能力显著提升,不止能写代码。
为什么值得看:Google 官方发布 Gemini 3.8 Flash,定位复杂多步 Agent 任务,推理能力显著提升。做 AI 工具链整合的可以关注 API 接入,看能否串进自动化剪辑或批量生成流程。
Google 在 Gemini Flash 系列模型上推出 agentic 视频理解,模型不再按固定 1 FPS 单遍读取视频,而是按需加载帧、音频和转录文本。官方称 token 最多减少 88%、成本降低 66%、标准视频基准准确率提升 7%。仅通过 Gemini API(Google AI Studio 和 Gemini Enterprise Agent Platform)提供,支持文件上传和公开 YouTube URL,按标准 token 计费无额外功能费,无开源权重。
为什么值得看:做 AI 后期和工具链的可以关注:视频理解不再按固定 1 FPS 全量读,而是按需取帧、音频和字幕,长视频分析成本能砍一大截,接 API 就能用。
Google 在 Gemini 中推出音乐生成模型 Lyria 3.5,主打更丰富的编曲、更具表现力的人声和更高保真度。用户可选择音乐类型、人声或纯器乐,探索新模板,并生成较短或更长的曲目。对后期和短剧团队来说,这意味着配乐和 BGM 的生成质量与可控性提升,可直接在 Gemini 内完成从选风格到出曲的流程。
为什么值得看:做后期配乐和短剧 BGM 的可以上手试,编曲丰富度和人声表现力是这次升级重点,能直接生成不同长度的曲目。
OpenRouter 推出视频模型横向评测功能,支持在多种挑战任务下并排对比不同视频模型。评测显示 Seedance 2.5 在物理模拟和指令遵循方面表现突出,新发布的 MiniMax H3 Max 则在生成速度和成本上树立新标杆。
为什么值得看:选视频模型前先来这拉个对比,Seedance 2.5 物理和指令遵循强,MiniMax H3 Max 主打速度和成本,做短剧的挑模型能省不少试错时间。
Magnific 官方演示角色参考图功能:将角色设定图(脸、眼镜、毛衣、波点)作为参考输入,每次生成都能保持完全一致。示例 prompt 为「羊毛毡定格动画女性角色参考图,纯白无缝背景」。该功能面向 AI 动画和短剧制作中的角色一致性需求。
为什么值得看:做角色一致性的视觉师可以点开看,官方演示了用一张角色参考图(脸、眼镜、毛衣、波点)在每次生成中保持完全一致,对 AI 动画和短剧的角色稳定很有参考价值。
创作者 @YuriWang49 实测 Astra,通过联网找参考、三维建模、动画和剪辑配乐,配合完整细节提示词,一次直出立体感和概念化的商业广告。提示词已放评论区。个人体验分享。
为什么值得看:个人实测分享:Astra 联网找参考、三维建模、动画剪辑配乐一次直出商业广告,做广告和视觉的可以翻评论区提示词跑一遍看效果。
开源项目 whiteboard-book-video-skill,提供白板火柴人拆书短视频的完整工作流,覆盖脚本、分镜、配音、BGM、字幕与 HyperFrames 本地渲染环节,可直接交给 Agent 执行或在此基础上魔改。
为什么值得看:做知识类短视频和拆书号的可以直接把整套工作流丢给自家 Agent 跑,脚本到本地渲染全包,省掉自己搭流程的时间。
针对AI视频人物一致性差、人脸塑料感问题,提出三种角色参考图方案。指出传统角色卡(白底三视图+近景上半身面部照)存在三视图正面面部信息不足等问题,需改用更有效的参考图组合来提升角色一致性。
为什么值得看:做AI短剧和视觉的常被角色一致性卡住,这篇直接给三种角色参考图做法,可以照着搭一套自己的角色卡工作流。
作者 Vincent文森特(@VincentWei93)新做了一款名为 video-talkcraft 的口播视频动效 skill,已开放安装试用。目前为初版,作者自述效果尚未达到满意程度,后续优化后会发布视频展示完全体效果。
为什么值得看:做口播、解说类视频的后期可以装来试试,目前是初版,作者说后续会优化并放完全体演示。
创作者 Sam Wasserman 的 AI 电影《奇迹》首映,个人倾注全力之作,在创意和技术上大量实验新工具与模型,经历困境与重来后完成。
为什么值得看:个人创作者倾注全部心血的 AI 电影首映,做 AI 长片和短剧的可以拉片看叙事和视觉一致性处理。
B站UP主「AI精品分享」的AI短剧系列《当新来的医生吸引了AI护士》第四集,单集约,延续该UP主「AI美女+日常情景」的轻喜剧小剧场风格,属于批量生产的短剧内容。
为什么值得看:B站UP主「AI精品分享」的AI短剧系列第四集,单集左右的轻喜剧,做AI短剧的可以扫一眼这类量产式小剧场的内容节奏。
B 站作者「鱼子酱不睡懒觉」发布的 AI 短片《跳个舞(58)》,动作类题材,配乐为《小城夏天》。个人创作者作品,看点集中在 AI 动作生成的自然度与节奏感。
为什么值得看:个人创作者的动作类 AI 短片,视觉师可当动作流畅度参考。
B站作者「众香阁AI」的AI短片《华服-微胖-唐装》,聚焦唐装华服与微胖体型表现,个人创作者作品,视觉风格偏古风服饰展示。
为什么值得看:B站作者「众香阁AI」的AI短片,标题聚焦华服唐装与微胖体型,视觉师可当风格参考,看角色一致性和服饰质感处理。