← 全部日报

AIGC 信息日报

2026 年 8 月 8 日 周六

行业与平台

Industry

Seedance 2.5 API 上线:单次生成 30 秒长叙事

火山引擎上线 Seedance 2.5 API,单次视频生成时长从 15 秒提升至 30 秒,支持最高 50 个全模态素材参考,指令遵循、长叙事、真人感及声画质感大幅提升,能稳定保持多角色外形与场景关系,兼容十余种语言。对 AI 短剧和长叙事创作者来说,单次 30 秒生成意味着更少拼接、更连贯的镜头,多角色一致性能力直接降低后期修脸成本。

单次生成时长翻倍到 30 秒,还支持 50 个素材参考,做 AI 短剧和长叙事的可以直接接 API 测一周,看多角色一致性和声画质感稳不稳。

点击打开原平台查看,能否访问取决于网络环境

阿里 Wan 视频模型公开测试版上线

阿里云官方账号宣布 Wan 视频模型公开测试版(Public Beta)正式上线,提供阿里云 Model Studio 和 Qwen Cloud 两个接入入口。这是阿里自研视频生成模型的公测开放,创作者可通过官方云平台直接调用,用于 AI 视频生成、短剧制作等场景。

阿里 Wan 视频模型公开测试版正式上线,官方提供两个云平台入口,做 AI 视频和短剧的可以直接上手实测出片效果。

文生图竞技场更新:GPT Image 2 全项第一

Artificial Analysis 更新文生图竞技场,按 10 类真实用例与 9 项能力评测模型,覆盖营销、电商、UI/UX 设计等场景。GPT Image 2 在所有用例和能力榜单均列第一;Nano Banana 2 以 $67/千图成为性价比之选,MAI-Image-2.5 是电商领域最佳廉价选项,Nano Banana Pro 则在真人电影领域表现突出。

做视觉和美术的可以当选型参考:GPT Image 2 全项第一,Nano Banana 2 是性价比之选,电商和真人电影场景各有最优解。

点击打开原文,能否访问取决于网络环境

MiniMax 与 ComfyUI 直播实测 H3 模型

MiniMax 官方宣布将于 8 月 7 日上午 10 点(PT)与 ComfyUI 联合直播,实时测试 H3 模型。直播内容包括:开放权重、原生立体声音频、最高 2K/15 秒片段生成,以及 H3 如何在消费级硬件上运行的讲解,并提供可直接使用的 ComfyUI 工作流模板。

MiniMax 官方下场和 ComfyUI 联播,现场跑 H3 的实时生成,还带现成工作流模板。做短剧和视觉的可以蹲直播看真实出片效果,顺便抄工作流。

点击打开原文,能否访问取决于网络环境

PixVerse 推出 AI 影视双赛道征集

PixVerse 官方发起 AI 影视作品征集,设两条赛道:Pilot Track 面向已完成 3-20 分钟 AI 电影或试播集(须用 PixVerse Canvas 制作);Script Track 面向有故事但未成片的编剧,需提交完整长片剧本加一段短视频 pitch。

PixVerse 官方发起 AI 影视征集,分「成片」和「剧本」两条赛道,做 AI 短剧和长片的团队可以看看参赛门槛和奖励,顺便当作品出口。

点击打开原文,能否访问取决于网络环境

MiniMax 开源后社区 4 天做出蒸馏 LoRA

MiniMax 官方宣布,开源权重 4 天后,社区即构建出蒸馏 LoRA,将采样步数从 20 步降至 4-8 步。官方称这正是开源的意义所在。对技术整合者来说,这意味着本地推理效率大幅提升,可降低批量生成成本。

MiniMax 开源权重后社区 4 天就做出蒸馏 LoRA,采样从 20 步降到 4-8 步。做本地部署和推理优化的技术整合者可以关注,出图速度直接翻倍。

点击打开原文,能否访问取决于网络环境

Sierra 推出 Voice Personas 自定义代理个性声音

Sierra 创始人 Bret Taylor 宣布推出 Voice Personas 功能,让企业为 AI 代理赋予个性化声音与性格,强调语音 AI 不应千篇一律,每家公司可定义自己的品牌声音。该功能面向企业客服代理场景,非影视创作工具。

Sierra 给 AI 代理加了个性化声音功能,主打品牌声音定制。做 AI 配音和虚拟角色对话的可以关注,但这是企业客服场景,跟影视创作关系不大。

点击打开原平台查看,能否访问取决于网络环境

OpenRouter:GPT-5.6 Luna 降价后用量涨 10 倍

OpenRouter 官方账号发布数据:GPT-5.6 Luna 在 OpenRouter 上的价格下调 10 倍后,token 用量随之增长 10 倍(本周尚未结束,预计将超过 10 倍),同时其用量已超越 GLM 5.2。该数据反映了降价对模型调用量的直接拉动效应。

OpenRouter 官方数据:GPT-5.6 Luna 在 OpenRouter 上降价 10 倍后,token 用量涨了 10 倍,还超过了 GLM 5.2。做 AI 短剧批量生成、跑长工作流的,降价意味着单条成片成本能压下来,值得关注后续价格走势。

点击打开原文,能否访问取决于网络环境

蚂蚁百灵 Ling-3.0-flash 支持本地部署

蚂蚁百灵推出 Ling-3.0-flash 本地部署方案,获 Atomic Chat 社区首日支持。Hugging Face 已发布从无损 BF16 到 1-bit 的 GGUF 量化版本及 NVFP4 格式。其中 AD-Q5_K_M 最适合 128GB 硬件(DGX Spark 测试),token 匹配率达 97.5%,漂移比同尺寸 llama.cpp 默认量化低 31%。

模型本地部署方案,对创作工作流影响有限,技术整合者可以关注量化版本和硬件适配情况。

点击打开原文,能否访问取决于网络环境

OpenAI 公布 Astra 网络安全评估与防护措施

OpenAI 官方博客发布 Astra 的初步网络安全评估结果,并说明为加强安全防护与控制所采取的措施。该内容聚焦于模型安全与网络防御能力,不涉及视频生成、图像编辑等创作功能,与 AIGC 创作管线无直接关联。

当天有 14 家独立信源在报同一件事,属于行业动向本身。对具体创作流程没有直接用处,但这个量级的消息值得知道。

点击打开原文

工具与能力

Tools

Magnific 上线 3D 运动控制:相机路径可视化设定

Magnific 推出 3D Motion Control 功能:相机路径在 3D 空间中直接设定,场景作为模型跟随的视频参考,同一运镜每次拍摄位置精确一致,已上线可用。对编导和短剧团队来说,镜头语言从文字描述变成可视化操控,多拍一致性大幅提升,适合做分镜预演和批量镜头生产。

相机控制从 prompt 里解放出来,直接在 3D 空间画路径,场景即参考、每拍机位一致。做分镜和短剧的可以上手试,镜头语言可控性上一个大台阶。

点击打开原平台查看,能否访问取决于网络环境

Seedance 2.5 上线 PixVerse,支持 30 秒多角色

Seedance 2.5 同日在 9 个第三方平台上线可用:Luma / Runway / Leonardo / PixVerse / Lovart / Magnific / FLORA / ElevenCreative / InVideo。

Seedance 2.5 当天在这 9 个平台都能用上,按手上已开通的账号挑一个直接测,不用等单一渠道。

点击打开原平台查看,能否访问取决于网络环境

Lovart 升级:单提示词生成连续长镜头视频

Lovart 官方宣布其提示词转视频工作流升级,核心卖点是单提示词生成连续镜头,无需拼接片段或放大处理,直接输出一条完整连续视频。官方已开放测试入口。

做 AI 短剧和视觉的可以上手测一下,单提示词出连续镜头,省掉拼接和放大,出片效率能提一档。

点击打开原文,能否访问取决于网络环境

剪映上线智能粗剪,18分钟口播自动剪成4分钟

剪映上线智能粗剪功能(SVIP 权益),用户实测将18分钟口播视频自动去除重复片段并剪辑为4分钟,气口保留准确率约90%。该功能面向口播、访谈等长视频素材的快速粗剪场景,可显著提升后期初筛效率。

剪映终于补上智能粗剪,实测把18分钟口播去重剪成4分钟,气口保留准确率约90%。做口播、访谈、短剧素材整理的后期可以直接上手试,能省不少粗剪时间。

点击打开原文,能否访问取决于网络环境

Suno 移动端上线 Voices 功能,可录制人声用于歌曲

Suno 官方宣布 Voices 功能正式上线 iOS 和 Android 移动端。用户可在创作界面点击 '+ Voice' 按钮,录制至少一分钟的人声,并将其应用到自己的歌曲中。该功能面向 Pro 及以上订阅用户开放,为 AI 音乐创作提供了更便捷的个性化音色输入方式。

Suno 把 Voices 搬上手机端,iOS 和 Android 都能直接录人声进歌里,做 AI 音乐和短剧配乐的后期可以上手试,录一段自己的声音当音色素材。

点击打开原平台查看,能否访问取决于网络环境

HyperFrames 推出 Claude Design MCP:动画一键转视频

HyperFrames 推出 Claude Design MCP:在 Claude Design 中完成动画制作后,点击分享,HyperFrames 代理会自动评分、添加音效、优化动作并渲染为 MP4 视频。该工具将原型设计与视频发布流程打通,面向动画制作与视频生成场景。

把 Claude Design 里的动画原型一键变成带音效、优化动作的 MP4,做视觉和后期的工作流能省不少手工环节,技术整合者可以直接接 MCP 试跑。

点击打开原平台查看,能否访问取决于网络环境

Grok 新增 21 种语音,全平台可用

Grok 官方宣布新增 21 种全新语音,现已覆盖 iOS、Android 和 Web 全平台。语音是 AI 对话与配音场景的核心素材,新增音色为创作者提供了更多角色声音选择,适合用于虚拟角色对话、有声内容或配音试音。

做 AI 配音和虚拟角色对话的可以试一批新音色,看有没有能直接进项目的。

点击打开原平台查看,能否访问取决于网络环境

Claude托管代理新增会话预算控制

Claude官方账号宣布本周为托管代理推出四项更新,首项为会话预算功能:可为会话设置预算以控制支出,达到限制的会话会暂停并触发budget_reached事件,可提高预算恢复会话。对用Claude托管代理跑批量生成、自动化剪辑等长任务的创作者,预算控制能有效管理成本,避免任务中途因额度耗尽中断。

做AI短剧批量生产或自动化剪辑链路的,托管代理的预算控制能帮你把成本锁死,跑长任务不怕超支,值得接API实测。

点击打开原平台查看,能否访问取决于网络环境

ElevenLabs 有声书新增语音聊天功能

ElevenLabs 为有声书场景推出 Voice Chat 功能,读者在收听过程中可随时就角色、情节或主题提问,系统以旁白同一声音实时回答,结束后可无缝回到收听状态。该功能将 AI 语音交互嵌入长音频消费流程,适用于有声书制作方、播客团队及 AI 配音后期探索互动式音频产品。

做有声书、播客和 AI 配音的后期可以关注,读者能直接跟旁白声音对话提问,再无缝跳回收听,交互体验是个新方向。

方法与经验

Methods

GPT-5.6 Codex 实测:复杂任务自动完成

X 用户 Tibo 实测:搭载 GPT-5.6 Sol 的 Codex 可执行任意复杂任务,连续对话 5 分钟布置看似需数周工作量的任务,离开片刻后即自动完成。个人体验分享。

个人实测分享:GPT-5.6 Codex 能自动执行看起来要几周工作量的复杂任务。做 AI 短剧和批量生产的可以接 API 试一周,看自动化链路能省多少人工。

RTX 4080 本地跑 MiniMax H3 实测:10 秒视频约 10 分钟出片

个人实测:MiniMax H3 已支持 ComfyUI 原生工作流,本地可跑。RTX 4080 16GB 用 pruned + int8 低显存版跑通,10 秒视频约 10 分钟出片。文章无保留分享模型版本、目录结构、ComfyUI 配置等细节。对短剧团队和批量出片场景,本地跑能省下 API 调用成本,适合有 16GB 显存显卡的创作者实测。

个人实测分享:MiniMax H3 已支持 ComfyUI 原生工作流,RTX 4080 16GB 靠 pruned + int8 低显存版跑通,10 秒视频约 10 分钟出片。做短剧和批量出片的可以照着省 API 成本,自己跑一遍看显存和出片速度能不能接受。

点击打开原文,能否访问取决于网络环境

PixVerse 分享角色一致性提示词模板

PixVerse 官方分享了一组用于生成双人角色设定的提示词模板,核心是通过参考图锁定角色关系、时尚态度、配饰与造型对比,并明确要求不复制原人物或服装。提示词强调一高一张扬、一冷一内敛的反差设定,适合用于需要角色一致性和风格区分的视觉开发场景。

做角色 IP 和系列短剧的可以收藏这个提示词结构,参考图驱动双角色风格对比,直接套用到自己的角色设定上。

FLORAai 分享 AI 画面元素定位与缩放技巧

FLORAai 官方账号发布一条方法类内容,主题是「别再跟提示词较劲:如何在 AI 生成中放置和缩放任意元素」。推文正文仅含标题与链接,未展开具体技术细节。

讲怎么在 AI 生成画面里精确摆放和缩放元素,视觉师和做分镜的可以点开看有没有可复用的控制方法。

豆包生成治愈短片《逃亡的文件》附完整分镜提示词

阿易 AI Notes 用豆包制作 15 秒治愈故事短片《逃亡的文件》:被清空回收站的小文件在键盘狂奔、躲进咖啡杯变小鱼、化纸鹤飞逃,最终钻进笔记本变成手写字被永久保存。视频将昏暗实拍与粗糙发光手绘帧动画融合,全程第一人称手持抖动视角,并附完整分镜提示词。

15 秒治愈向短片,实拍与手绘帧动画融合,附完整分镜提示词,做治愈系短内容的可以直接套用这套叙事和提示词。

点击打开原平台查看,能否访问取决于网络环境

Stripe 用 Deep Agents 一周搭出企业级 AI 智能体 Kai

Stripe 基于 LangChain、LangGraph 和 Deep Agents 构建公司级 AI 智能体 Kai,从搭建到上线仅耗时一周,约 4 周内用户数达 5000 人。案例展示了 Deep Agents 框架在企业内部快速部署 AI 助手的可行性。

企业级 AI 智能体落地案例,4 周 5000 用户,做 AI 工具链整合的可以看 Deep Agents 框架怎么在企业内部快速部署。

点击打开原文

fofr 用 AI 生成夜间森林跑酷短片

fofr(@fofrAI)发布一段 AI 生成的夜间森林跑酷视频,时长 20 秒,内容为头灯照射下的森林跑酷,随后发现身处巨大室内森林并穿门而入。

fofr 的 AI 生成短片,20 秒夜间森林跑酷转室内场景,视觉师可拉片看镜头运动和场景转换处理。

点击打开原平台查看,能否访问取决于网络环境

Geek 用 12000 行代码程序化生成丛林小径场景

开发者 @geekbb 分享用 12000 行手写 JavaScript 在 Three.js 中程序化生成完整丛林小径场景,无贴图、无模型、无录音,树叶、树皮、石头、角色皮肤和 60 段音频全部在加载时由代码实时计算生成。

纯代码生成完整 3D 场景的硬核玩法,不依赖任何外部美术资源,做技术美术和程序化内容生成的可以看看这套思路。

点击打开原平台查看,能否访问取决于网络环境

博主评晚点报道:小团队跑赢大厂靠的是现成基建

博主柯基是只猫对晚点报道的评论:WorkBuddy 虽由产品经理带三人周末做出,但直接复用 CodeBuddy 现成基建和 Agent SDK,而 CodeBuddy 是十来人打磨一年的项目;反例 MuleRun 自下而上试了多个方向全没跑通。WorkBuddy 日活已达百万量级,超越国内所有竞争对手。

行业观点,讲 WorkBuddy 周末做出来靠的是 CodeBuddy 一年打磨的基建,对 AI 办公赛道有兴趣的可以看看,跟创作工作流关系不大。

AI 视频看多了,一眼能分辨谁懂叙事

A.I.Warper 个人观点:看过成千上万 AI 视频后,能立刻分辨创作者是否真正理解叙事和导演技巧,这种理解源于 AI 知识出现之前对基础原理的掌握,在 Seedance 时代更加明显。

个人观感分享:AI 视频看多了,能一眼分辨创作者是否真正懂叙事和导演技巧,尤其在 Seedance 时代更明显。编导可当闲聊参考。

作品与案例

Works

大明14444:赛车装大炮的AI短片

B站UP主「星海大明锦衣卫AIGC」的AI短片《大明14444:赛车装上大炮,还能叫赛车吗?》,属于「AI全民制作人」参赛作品。题材为明朝背景与赛车、大炮元素的混搭脑洞,偏向喜剧或动作向的短剧风格。

B站AI全民制作人参赛作品,题材是明朝背景加赛车大炮的混搭脑洞,做AI短剧的可以拉片看题材创意和视觉风格。

点击打开原平台查看

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索