← 全部日报

AIGC 信息日报

2026 年 8 月 21 日 周五

行业与平台

Industry

Stripe 75 亿美元收购 AI 模型路由平台 OpenRouter

Stripe 宣布以 75 亿美元收购 AI 模型路由平台 OpenRouter,对比其 5 月 13 亿美元估值溢价极高。OpenRouter 团队约 90 人,拥有超 1000 万开发者用户,聚合 400+ AI 模型,日处理推理量超 10 万亿 tokens。官方称业务不受影响,产品名称、架构、路线图及 API 对接方式均保持不变。

AI 模型路由平台被巨头高价收购,做工具链整合的可以关注后续 API 稳定性与定价变化,对创作工作流影响有限。

点击打开原文,能否访问取决于网络环境

OpenAI 发布浏览器操作智能体,可执行任意操作

OpenAI 推出可在浏览器中执行任意操作的智能体,用户 @clairevo 列举了实际用例:关闭会计软件账目、管理 Gmail 收件箱、设置 Stripe Radar 规则、在 Midjourney 中迭代图片、完成安全问卷、注册会议及取消订阅等。该智能体还支持通过 iPhone 镜像在桌面端操作移动应用。对创作者来说,这意味着 Midjourney 图片迭代、素材整理等重复性操作可以交给智能体自动完成,节省大量手动时间。

OpenAI 官方发布的浏览器操作智能体,能自动处理会计、邮件、Midjourney 迭代等杂活。做 AI 短剧和视觉的可以把它当自动化助手,把重复性操作交给它跑。

FLUX Upscale 发布:视频可升级至原生 4K

Black Forest Labs 推出 FLUX Upscale,可将任意视频重新生成至更高分辨率,最高支持原生 4K,已作为独立 FLUX Tool 和 API 端点提供。支持 1.5x/2x/3x 放大,从 HD 输入可到 1080p/2K/4K。两种模式:Precise(4 步,$0.07/mp/s,保持身份和参考细节一致)和 Creative(8 步,$0.10/mp/s,更多修复和细节生成,可能改变身份)。原生理解 FLUX 3 输出,能修复通用放大工具遗漏的模糊面部、水面和草地网格伪影。

做后期和视觉的可以直接接 API 试,480p 拉到 4K 还顺手修脸和纹理瑕疵,比本地放大稳。

点击打开原文

商汤开源 SenseNova U1.5 Lite 轻量多模态模型

商汤官方发布 SenseNova U1.5 Lite,定位开源、轻量级的原生统一多模态模型,覆盖视觉理解、生成与编辑。主打更可控、更具成本效益,面向开发者开放。

商汤官方开源轻量级统一多模态模型,主打可控性和成本效率,做视觉生成和工具链整合的可以关注下模型能力边界。

点击打开原文,能否访问取决于网络环境

OpenRouter 上线 Ox Alpha 编码模型,支持 1M 上下文

OpenRouter 发布新模型 Ox Alpha,定位高效编码与持续 Agent 工作,支持 1M token 上下文窗口,可输入文本、图像和视频,已开放试用并征集反馈。对创作者来说,1M 上下文意味着可一次性处理长剧本或批量素材,但模型主打编码场景,对视频生成本身无直接增益。

新模型上线,主打高效编码和长时 Agent 任务,1M 上下文窗口对长脚本处理有参考价值,做工具链整合的可以接 API 试跑。

点击打开原文,能否访问取决于网络环境

MiniMax 发布创作 Agent 工作台 Design,释放 H3 生产力

MiniMax 今日发布多模态创作 Agent 工作台 MiniMax Design,基于原生多模态视频模型 H3 构建。用户提出创作需求后,Agent 可理解目标、拆解任务,调用模型与 Skills 完成素材处理、内容生成、编辑和交付,并补充了音视频生成前的分镜规划及生成后的剪辑装配能力。H3 具备多模态理解、视频生成、视频编辑和参考控制能力,尤其适合视频编辑任务。

MiniMax 把 H3 从模型升级成能拆任务、管素材、做分镜和剪辑的创作工作台,做短剧和后期的一站式流程可以实测,看它能不能把从构思到成片的活串起来。

点击打开原文

Adobe Firefly 上线三款 AI 音频工具并接入 Gemini

Adobe 在 Firefly 平台正式推出三款 AI 音频工具:Generate Music 生成免版税音乐、Generate Speech 将脚本转为配音、Generate Sound Effects 制作场景音效,均宣称可用于商业用途。Firefly AI Assistant 现提供每日免费生成次数,并新增 Gemini Omni Flash 模型,支持视频、音频、图像及文本输入。

做后期和短剧的可以关注:Firefly 把配乐、配音、音效三件套一次给齐,还宣称商用无风险,接进现有工作流能省不少外包钱。

点击打开原文

一人十天手搓90分钟AI电影《聂小倩》

抖音博主孙晨熙一人用十天制作出90分钟AI电影《聂小倩》,预估消耗约421万积分,成本约30-40万人民币。该消息由博主小奇转发,目前仅有预告片流出。对AI长片创作者来说,这是单人产能和成本投入的极端样本,可参考其制作规模与资源消耗量级。

一个人十天做90分钟长片,成本30-40万,做AI短剧和长片的可以看看这个成本量级和单人产能的极限在哪。

点击打开原平台查看,能否访问取决于网络环境

Claude Academy 上线,免费课程开放学习

Anthropic 官方推出 Claude Academy 学习平台,面向从 AI 新手到日常重度用户的不同水平人群,提供免费课程和教程,任何人可通过 academy.claude.com 访问。

Anthropic 官方学习平台上线,课程免费开放。想系统了解 Claude 能力边界的创作者可以逛逛,看有没有能接进自己工作流的用法。

点击打开原平台查看,能否访问取决于网络环境

Ideogram 两款新模型上线 Runware

Ideogram 两款新模型上线 Runware 平台:4.0q 为 9.3B 参数的开源量化版 V4.0,模型已可在 Runware 上调用,面向图像生成场景,适合视觉风格测试和批量出图工作流。

Ideogram 4.0q 开源量化版和另一款新模型接入 Runware,做视觉和短剧的可以接 API 跑一批图看风格一致性,工具党顺手测下出图速度。

点击打开原平台查看,能否访问取决于网络环境

MiniMax 联合 ComfyUI 办 H3 挑战赛,奖品 RTX 5090

MiniMax 官方宣布与 ComfyUI 合作举办 H3 挑战赛,参赛者需在 9 月 1 日前提交基于 H3 模型的作品,优胜者可获得 RTX 5090 或 5060 Ti 显卡。赛事面向 AI 创作者,具体规则和提交方式见官方详情。

MiniMax 和 ComfyUI 合办 H3 创作挑战赛,9 月 1 日前提交作品,赢 RTX 5090 或 5060 Ti。做 AI 短剧和视觉的可以顺手参赛,既是练手也是拿硬件的路子。

点击打开原文,能否访问取决于网络环境

工具与能力

Tools

GPT-Image-2 API 新增透明背景预览

OpenAI 官方宣布 GPT-Image-2 在 API 中新增透明背景预览功能,可生成可复用的透明底素材,适用于产品图、平面设计、网站原型和营销活动等场景。对视觉师和素材生产团队来说,这意味着可以直接在生成阶段产出透明底素材,省去后期抠图步骤,批量制作和素材复用效率会明显提升。

做视觉和素材生产的可以直接接 API 测,透明底素材能省掉抠图环节,产品图、海报、网站原型都能直接复用。

点击打开原平台查看,能否访问取决于网络环境

Claude 平台四大功能全面开放

Claude 官方宣布 Computer use、浏览器工具、Skills API 和 Files API 四大功能在 Claude 平台上全面可用(GA)。核心能力是:在无 API 的应用程序中实现工作自动化,减少每个任务的任务往返次数;并支持基于版本化技能和可复用文件构建 Claude 托管智能体。对创作者来说,这意味着可以把素材抓取、转写、批量处理等重复环节交给 Claude 智能体自动完成,减少手动切换工具的次数。

Computer use、浏览器工具、Skills API 和 Files API 全面开放,做自动化工作流的可以直接接上,把重复的素材整理、转写、发布环节串起来跑。

点击打开原平台查看,能否访问取决于网络环境

Recraft Studio 接入五款外部模型,一个画布统一调用

Recraft Studio 上线五款外部模型:Grok Imagine Image 2、MiniMax H3、Flux 3 Video、Qwen Image 3 Pro 和 Reve 2.1,支持在一个画布内统一调用并生成创意内容。对视觉师和短剧团队来说,这意味着可以在同一工作流里混用不同模型的图像与视频生成能力,减少工具切换成本。

做视觉和短剧的可以试试把 Grok Imagine、MiniMax H3、Flux 3 Video 这些模型在一个画布里串着用,省得来回切工具。

点击打开原文,能否访问取决于网络环境

Magnific 接入 MiniMax 模型,支持参考图定义角色

Magnific 平台宣布接入 MiniMax 模型,支持通过参考图(vid1)定义人物身份与场景(如东京人行横道、阴天、人群、红色巴士等),用于生成视频。该功能面向视觉开发与角色一致性场景,可直接在 Magnific 平台使用。

Magnific 平台接入了 MiniMax 模型,可以用参考图锁定角色身份和场景,做角色一致性的视觉师可以上手试一下。

点击打开原文,能否访问取决于网络环境

HeyGen 新增头像一键精修功能

HeyGen 官方宣布头像精修功能上线,可一键清除瑕疵、淡化皱纹、增强妆容、调整光线,并支持用户完全控制精修程度,强调处理后仍保持个人辨识度。该功能旨在让数字人视频无需重拍即可呈现最佳状态。

HeyGen 给数字人头像加了精修功能,去瑕疵、磨皮、调妆、调光,还能控制修图强度。做虚拟主播和数字人内容的后期可以省掉不少外挂修图步骤,直接套用。

点击打开原平台查看,能否访问取决于网络环境

Pika 发布 Music 模型,成本低 10 倍可多层输入

Pika 官方发布新 Music 模型,主打成本优势,宣称比其他音乐模型便宜最多 10 倍,并支持多层输入叠加以精确控制生成结果。官方展示了数首用该模型制作的曲目,并开放 Pika API Club 供创作者试用。

做后期配乐和短剧 BGM 的可以接 API 试,多层输入混音这个点对需要精确卡点的场景挺实用。

点击打开原文,能否访问取决于网络环境

Meta 开源 Muse Spark 1.2 免费上线 OpenCode

Meta 的 Muse Spark 1.2 贡献者模型现已在 OpenCode 中免费提供,并已扩展到更多地区上线。该模型由 @aiatmeta 贡献,可直接在 OpenCode 平台调用,适合集成到 AI 编程与自动化创作工作流中。

Meta 的 Muse Spark 1.2 模型免费接入 OpenCode,做 AI 编程和自动化工作流的可以直接接上跑,省一笔模型调用费。

Lovart 新增字体生成器,可据图片或文字造字

Lovart 官方宣布新增 Font Generator 字体生成器,可从用户提供的图片或一句文字描述生成真实可用的字体,旨在解决设计工具自带字体库同质化的问题。该功能面向视觉设计场景,可直接生成成品字体文件。

做视觉和美术的可以试试,从参考图或一句话直接生成可用字体,做标题字、片头字、海报字能省不少找字体的时间。

点击打开原平台查看,能否访问取决于网络环境

FLORA 接入 Shopify,批量刷新商品页与广告素材

FLORA 官方宣布接入 Shopify,支持批量刷新数百个商品详情页(PDP)、生成数百个广告变体,并可将定稿素材直接推送至 Shopify 后台,无需下载或重新导入。面向电商广告素材批量生产场景,适合做商品图、广告投放素材的团队。

做电商广告素材的团队可以接上试试,批量出变体和直接推送到 Shopify 后台,省掉来回导素材的功夫。

点击打开原平台查看,能否访问取决于网络环境

FishAudio 接入 Vercel AI Gateway,9 月 18 日前免费

FishAudio 官方宣布其服务已上线 Vercel 的 AI Gateway,开发者可通过该网关调用其音频生成能力,9 月 18 日前免费使用。对 AI 配音、音效生成等后期工作流来说,多了一个可集成的 API 入口,适合已有 Vercel 技术栈的团队直接接入测试。

做 AI 配音和后期的工作室,如果已经在用 Vercel 的 AI 网关,可以直接把 FishAudio 接进现有工作流,9 月 18 日前免费,值得顺手测一下。

点击打开原文,能否访问取决于网络环境

方法与经验

Methods

MiniMax H3 工作流:分镜图直接生成完整预告片

@magnific 分享 MiniMax H3 工作流:从成片提取关键帧,将帧与镜头描述一起输入 H3,模型可在每个剪辑间保持风格一致,将分镜图转化为完整预告片。

把成片抽帧喂给 H3 配镜头描述,就能保持风格一致地生成预告片,做短剧和视觉的可以直接套这套工作流跑一遍。

点击打开原平台查看,能否访问取决于网络环境

Luma 官方教程:12 条提示词让 AI 视频不像 AI 生成

Luma AI 官方博客发布提示词教程,提供 12 条让 AI 视频看起来不像 AI 生成的提示词模板,聚焦写实风格、自然光影、镜头语言等去 AI 味的关键点,适合写实向短片和广告制作参考。

官方出的提示词教程,12 条现成模板直接抄,做写实向 AI 短片的编导和视觉师可以拿来当 prompt 库用。

点击打开原文

Codex 帮 Asana 两周完成五年代码迁移

OpenAI 联合创始人 Greg Brockman 转发官方案例:Asana 用 Codex 在两周内完成从 Enzyme 到 React Testing Library 的前端测试迁移,该项目原本预计还需五年。这是 AI 编程 Agent 在真实企业工程中的效率验证案例。对 AIGC 创作者来说,这条属于 AI 编程工具的能力展示,与影视创作工作流无直接关联,但可作为 AI Agent 自动化能力的参考样本。

OpenAI 官方案例:Codex 把 Asana 预计五年的前端测试迁移压缩到两周。做 AI 自动化工作流整合的可以看看 Agent 在真实工程里的效率边界,但跟拍片关系不大。

点击打开原文,能否访问取决于网络环境

Thumbtack 创意总监用 Google Flow 拍护理人员短片

Google Flow 官方发布《The Small Brief》系列案例,展示 Thumbtack 创意工作室负责人 Jayanta Jenkins 的创作过程。他聚焦支持护理人员的组织 ARCHANGELS,以“See Yourself”为核心构建影片,用镜子作为视觉隐喻,让主角依次看到所爱之人的倒影,最后看到自己。Jayanta 评价 Flow 将工艺推得更远更快,但最终判断仍由人来定。

官方展示的创作案例,看点是导演如何用一句核心文案驱动整支影片的视觉隐喻,做品牌向 AI 短片的编导可以拉片学叙事结构。

点击打开原平台查看,能否访问取决于网络环境

创作者用 MiniMax H3 重现温泉关战役

创作者 MayorkingAI 用 MiniMax H3 在 Magnific 平台制作动画希腊陶器风格视频,重现温泉关战役,并附有提示词。展示了历史题材结合特定美术风格的 AI 视频生成工作流。

用 MiniMax H3 在 Magnific 里做动画希腊陶器风格,历史题材视觉风格化可以当参考,做视觉和编导的可以看看这个风格怎么落地。

点击打开原平台查看,能否访问取决于网络环境

Seedance 2.5 复古日式餐厅静帧作品与提示词

创作者 @im_shahid7 使用 Seedance 2.5 在 @lovart_ai 平台生成写实电影感 1950 年代日式餐厅静帧作品,并公开了完整提示词(Photorealistic cinematic 1950s japanese diner, chrome sto...)。

视觉师可参考其 1950 年代日式餐厅的写实电影感提示词写法,直接套用风格化场景描述。

点击打开原平台查看,能否访问取决于网络环境

Stampli 用 ChatGPT Work 压缩发布工时 68%

OpenAI 官方博客发布客户案例:Stampli 在固定截止日期和设计资源被占用的情况下,用 Codex 和 ChatGPT Work 将原本数周的发布生产工作压缩至数天,发布工时削减 68%。属于企业级 AI 效率案例,面向业务发布场景而非影视创作。

OpenAI 官方客户案例,讲 Stampli 用 Codex 和 ChatGPT Work 把几周的发布生产压到几天。做 AI 制片和工具链整合的可以看下官方怎么包装这类效率故事,但本质是营销向案例,对拍片本身参考有限。

点击打开原文

ChatGPT 快捷键:Cmd+Enter 后台排队任务

ChatGPT 高级用户功能:按 Cmd+Enter 可在后台发送提示,一次性排队大量任务,模型完成后通知用户。适合批量处理重复性文案、脚本生成等任务,提升效率。

一个提升 ChatGPT 使用效率的小技巧,适合批量处理文案、脚本等重复任务的创作者,顺手就能用上。

点击打开原平台查看,能否访问取决于网络环境

作品与案例

Works

Magnific 用 MiniMax H3 生成完整故事短片

Magnific 官方账号发布一支完整故事短片,全片由 MiniMax H3 生成,该模型由 MiniMax 提供,短片可在 Magnific 平台观看。

官方账号用 MiniMax H3 做了一支完整故事短片,做 AI 短剧和视觉的可以点开拉片,看 H3 在长叙事和风格一致性上的实际表现。

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索