← 全部日报

AIGC 信息日报

2026 年 7 月 24 日 周五

行业与平台

Industry

https:// bfl.ai/blog/flux-3 27…

Black Forest Labs 创始人 Robin Rombach 官宣 Flux 3 模型正式发布,官方博客已上线。Flux 系列是当前 AI 图像生成领域的主流模型之一,新版本在图像质量、风格一致性和生成稳定性上预计有显著提升,具体技术细节和参数需查看官方博客。

Flux 3 正式发布,Black Forest Labs 创始人 Robin Rombach 亲自官宣。做 AI 视觉和短剧的这周必须实测,图像生成质量又升了一档,出片废片率大概率能降。

点击打开原平台查看,能否访问取决于网络环境

Introducing Runway Media Route…

Runway 发布 Media Router,首个面向生成媒体的偏好优化路由工具。用户只需设定一次偏好(成本、质量或延迟),路由自动为每次请求选择最合适的视频、图像或音频模型,无需手动指定。适用于批量出片、多模型工作流编排等场景,降低人工调参和模型选择成本。

Runway 出了个生成媒体路由,不用再给每个任务手选模型,设好成本/质量/延迟偏好自动匹配。做批量出片和工具链集成的可以直接接 API 跑一周,省掉不少人工调参时间。

点击打开原平台查看,能否访问取决于网络环境

AI 电影制作刚刚迎来了它的 Blender 时刻。 Fli…

Flick 发布 3D Stage,一个 AI 代理驱动的 3D 场景搭建工具,内置于 AI 视频工作流中。用户无需学习 Blender,通过 AI 代理即可完成场景搭建、摄像机运动和镜头调度,输出 Blender 级质量的结果,目前免费使用。

Flick 把 Blender 级别的 3D 场景搭建能力塞进 AI 视频工作流,还不用学软件。编导和短剧团队可以直接在 3D 空间里摆机位、走调度,出片效率能提一档。

点击打开原平台查看,能否访问取决于网络环境

微软发布 MAI-Image-2.5-Pro 和 MAI-V…

微软发布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 公开预览。MAI-Image-2.5-Pro 定位为当前最高保真度图像模型,定价为文本输入每百万 token $5、图像输入每百万 token $8、图像输出每百万 token $106。MAI-Voice-2-Flash 为语音模型。

微软把最高保真度的图像模型和语音模型都放进了公开预览,做视觉和后期配音的可以接 API 测一周,看图像输出质量和语音合成效果能不能直接进管线。

点击打开原文,能否访问取决于网络环境

Andrew Ng 发布 OpenWorker:开源本地优先…

Andrew Ng 发布 MIT 许可的开源桌面 AI 智能体 OpenWorker,核心能力是直接交付完成的文档、更新后的日历等成品文件,而非对话回复。架构为 Tauri 2 + React 外壳下的本地 Python FastAPI 服务器,支持用户自带密钥接入 30 种精选模型及本地 Ollama。

吴恩达开源了一个桌面 AI 智能体,核心是直接交付成品文件而不是跟你聊天。做 AI 短剧和后期整合的可以接进自己的自动化管线,省掉人工中转环节。

点击打开原文

AI短剧成美国娱乐应用新势力

投资人 Deedy Das 发推指出,美国娱乐应用 Top 50 中有 12 款属于 AI 短剧类(每集 30-60 秒的 AI 生成节目),全球月活跃用户超 2.5 亿,发行商大多来自中国,用户 70% 为女性。

美国娱乐 App 前 50 里 12 款是 AI 短剧,全球月活超 2.5 亿,发行商大多来自中国。做短剧的制片人和编导应该看看这个赛道已经长到多大了。

点击打开原文,能否访问取决于网络环境

Sonilo 发布 Sound Effects 1.0 视频…

Sonilo 推出 Sound Effects 1.0,视频原生音频模型,能读取画面运动、场景和节奏生成同步音效。支持无需提示词的自动视频转音效,以及从文字描述生成独立音频。在对比基准测试中,音乐和音效均超越领先模型。

视频原生音频模型,能读画面运动自动生成同步音效,后期和短剧团队可以接 API 测一周,看废片率降多少。

点击打开原平台查看,能否访问取决于网络环境

北京发布智能体新政,10条措施布局Agent经济

北京市发布《关于加快智能体引领发展的若干措施》,共10条,将 Harness Engineering(驾驭层工程)、Token 经济、AIP 等概念写入正式政策。文件强调提升基础模型“实际任务完成能力”,强化上下文管理、长期记忆、多Agent编排等底层技术,并推动智能体原生应用、终端融合(手机/眼镜/机器人)及“芯模云端用”协同发展。

北京把 Harness Engineering、Token 经济这些前沿概念写进正式政策,做 AI 工具链和 Agent 集成的可以看看政策风向,判断哪些方向会有资源倾斜。

点击打开原文,能否访问取决于网络环境

Claude Opus/Sonnet 即将登陆语音模式

据 TestingCatalog 爆料,Anthropic 即将为 Claude 语音模式上线 Opus 和 Sonnet 模型。新模型选择器已在 UI 中隐藏约三周,默认使用 Haiku,现已更新为通过 Opus 和 Sonnet 响应。系统仍基于 TTS,但能处理中断并支持 Connectors,工具访问范围更广,能力超越 ChatGPT 当前方案,高推理任务的使用成本可能较高。

Claude 语音模式即将支持 Opus/Sonnet 模型,中断处理和工具调用能力比 ChatGPT 更强。做 AI 配音和虚拟角色对话的可以关注上线后实测延迟和自然度。

点击打开原平台查看,能否访问取决于网络环境

Palmier Pro:专为 AI 打造的开源 macOS …

Palmier Pro 是一款开源的 macOS 视频编辑器,专为 AI 工作流设计,支持时间轴编辑,集成 AI 功能用于加速剪辑、生成字幕或处理素材。项目已在 GitHub 发布,面向开发者和视频创作者开放。

开源 macOS 原生 AI 视频编辑器,后期和整合者可以装起来跑一遍,看 AI 字幕和素材处理能不能塞进现有剪辑管线。

点击打开原文

工具与能力

Tools

HyperFrames -> Video Agent

HeyGen 将旗下 HTML 动效框架 HyperFrames 集成至视频 Agent 中,用户只需输入提示词,Agent 即可自动生成包含数字人、图形动画、字幕和音乐的完整视频,支持无限自定义修改。该功能将动效模板与 AI 视频生成管线打通,降低了多元素合成视频的制作门槛。

HeyGen 把 HTML 动效框架塞进视频 Agent,一句话生成带数字人、图形、字幕、音乐的完整视频。做短剧和广告片的可以直接用这个管线批量出片,省掉后期拼合环节。

点击打开原平台查看,能否访问取决于网络环境

ChatGPT Voice is now in the de…

OpenAI 将 ChatGPT Voice 语音交互功能集成至桌面端应用,基于 GPT-Live 模型驱动,支持用户通过语音同时控制电脑、调度 ChatGPT Work 或 Codex 中的多个 Agent 协同工作,具备实时语音对话与任务协调能力。今日起全球逐步推送。

ChatGPT 桌面端语音上线,能同时说话、听指令、调度多个 Agent 干活。做 AI 后期和工具链整合的可以接上试试,看能不能用语音串起剪辑/转写/发布流程。

点击打开原平台查看,能否访问取决于网络环境

One video, one language

HeyGen 推出 Video Translation API,支持将一条视频批量翻译并生成 10 个本地化语种版本,宣称 24 小时内完成全渠道分发。提供 API 接口和批量处理入口,适用于多语种内容出海、短剧本地化、MCN 多语种分发等场景。

HeyGen 把视频翻译做成批量 API 了,一条原片 24 小时内出 10 个语种版本。做短剧出海和 MCN 多语种分发的可以直接接 API 跑一轮,省掉人工配音和字幕重做的时间。

点击打开原平台查看,能否访问取决于网络环境

The right sound changes everyt…

Leonardo 宣布将 ElevenLabs 的音乐、人声和音效能力集成至其 AI 创作平台 Leo 中,用户可在生成视觉内容的同时直接添加音频,无需切换工具。该功能旨在让项目在视觉和听觉上同步完成,提升创作效率。

Leonardo 把 ElevenLabs 的音频能力直接塞进自家生成工具里,做 AI 短剧和动画的可以省掉后期配音对轨的步骤,出片效率能提一档。

点击打开原平台查看,能否访问取决于网络环境

阿里Qwen TTS模型上线OpenRouter

阿里 Qwen-Audio-3.0-TTS 的 Flash 和 Plus 两个版本已在 OpenRouter 上线,支持 16 种语言,可通过【gasp】【giggles】【angry】等内联提示词控制语气和情感,实现更自然的语音合成。

阿里 Qwen TTS 上线 OpenRouter,支持 16 种语言和情感内联指令,做 AI 配音和后期声音的可以直接接 API 测一周,看自然度和可控性够不够进管线。

With Fish Audio’s Voice Design…

Fish Audio 推出 Voice Design 功能,用户可通过文字描述快速生成独特、富有表现力的语音,无需复杂参数调整。该功能面向 TTS 场景,适用于角色配音、虚拟人声等创作需求。

Fish Audio 的语音设计功能,从想法到独特人声只需几秒。做配音、短剧角色声音的后期和编导可以上手试试,看能不能替代传统调参流程。

点击打开原平台查看,能否访问取决于网络环境

Deepgram 两款音频模型上线 OpenRouter

OpenRouter 上线 Deepgram 两款音频模型:Nova-3 用于语音转文字(支持单语和多语转录),Aura-2 用于文字转语音(支持多语言语音库)。创作者可通过 OpenRouter API 直接调用,无需单独对接 Deepgram。

Deepgram 的 Nova-3 和 Aura-2 上了 OpenRouter,做 AI 配音和字幕的可以直接调 API 用,不用单独接 Deepgram 了。

Bringing Nunchaku 4-bit Diffus…

Hugging Face 将 Nunchaku 4-bit 扩散推理引擎集成至 Diffusers 库,基于 SVDQuant 方法实现 W4A4(4-bit 权重和激活)推理,相比 BF16 精度可大幅降低显存占用(从 20-30GB 降至消费级显卡可用),同时加速去噪循环。此前需单独使用 Nunchaku 库,现可直接在 Diffusers 生态内加载量化检查点。

Hugging Face 把 Nunchaku 的 4-bit 推理引擎直接集成进 Diffusers 了,跑大模型显存需求从 20-30GB 降到消费级显卡也能跑。做技术整合的可以接进来测推理速度和出图质量。

点击打开原文

方法与经验

Methods

Seedance 2.0 故事板的力量 → 从单一生成中获得…

Magnific 官方发布 Seedance 2.0 故事板功能演示:从单一生成中获得多个镜头,角色一致性贯穿每个剪辑,并展示复古水墨风格从头到尾的完整效果。附完整 prompt("Retro cinematic anime, 1990s hand-painted cel animation, legendary samurai duel, old manga aesthetic.")。

Magnific 官方演示 Seedance 2.0 故事板功能:单次生成出多镜头、角色跨剪辑一致、复古水墨风格从头到尾。做 AI 短剧和视觉开发的可以直接套这个工作流跑一遍,看角色一致性在长叙事里稳不稳。

点击打开原平台查看,能否访问取决于网络环境

5/Key techniques that made it …

PixVerse 官方账号分享 5 个让 AI 视频看起来更专业的关键技巧:用精确时间码(0-1.2s、1.2-2.5s 等)控制剪辑节奏;重复主角描述词(如“Black male protagonist”)保持面部和服装一致性;给出精确的生物规格描述(30 米海蛇、黄色竖瞳、18 米巨齿鲨等)。

PixVerse 官方拆解了 5 个让 AI 视频看起来更专业的技巧,从时间码控节奏到角色描述词保持一致性,做 AI 短剧和视觉的可以直接套用这套 prompt 写法。

另一个 FLUX 3 早期访问测试。 第一人称 GoPro …

创作者 Christopher Fryant 分享 FLUX 3 早期访问测试片段:第一人称 GoPro 视角,驾驶巨型机甲用剑与怪兽战斗,并用西雅图太空针塔击打怪兽。输出时长 20 秒,展示了 FLUX 3 在动态运镜、复杂场景和物理交互方面的生成能力。

FLUX 3 早期测试片段,20 秒输出,第一人称机甲打怪兽的 GoPro 风格镜头。视觉师和编导可以看看这个模型在动态运镜和复杂场景生成上的表现力,跑一遍就知道质感到哪了。

点击打开原平台查看,能否访问取决于网络环境

RT @DreamLabLA: This is how it…

LumaLabsAI 转发 DreamLabLA 的幕后制作拆解,展示艺术家 Bryan Soegondo 的 AI 短片《LaCrimosa》前期筹备过程,重点在预制作阶段如何搭建视觉基础。

Luma 官号转发的幕后拆解,看艺术家 Bryan Soegondo 怎么做《LaCrimosa》的前期筹备。做 AI 短片的可以拉片学他的分镜和视觉开发流程。

点击打开原平台查看,能否访问取决于网络环境

Ethan Mollick 发布 2026 夏季版 AI 工…

沃顿商学院教授 Ethan Mollick 发布 2026 夏季版 AI 工具选择指南,按任务类型推荐模型:复杂写作首选 Claude,编程首选 Claude Code,深度研究推荐 Gemini,创意生成推荐 Midjourney 或 Sora。指南强调无通用最佳模型,应依任务选择工具。

沃顿教授按任务场景推荐模型,复杂写作、编程、深度研究、创意生成各有首选。做 AI 整合和工具选型的可以当参考框架,不用自己挨个试错。

点击打开原文

Seedream Pro 5.0 外观测试,用于我计划的一个…

创作者 Roope Rainisto 分享 Seedream Pro 5.0 的外观测试图,用于其计划中的短片。他认为该版本在提示理解和视觉质量上表现不错,在某些场景下可替代 gpt-image-2 和 Nano Banana。

视觉师和编导可以看看 Seedream Pro 5.0 现在的出图质感,当个备选工具参考。

点击打开原文,能否访问取决于网络环境

I watched this three times. No…

创作者 Voyz 用 AI 工具生成了一段 19 秒的一镜到底追车戏,输入仅为「大楼内持枪男子,箭头标注 1→2→3→4」的极简提示词,AI 自动完成从室内跑出到街上的连续镜头,无剪辑点。展示了 AI 在长镜头运动逻辑和空间连贯性上的能力。

19 秒 AI 生成一镜到底追车戏,编导和短剧团队可以拉片看镜头连贯性和运动逻辑,当个灵感 demo 收藏。

点击打开原平台查看,能否访问取决于网络环境

焚决​ Codex里面免费用Grok批量抓取X热帖升级版——…

博主「逸尘」分享了一套工作流:在 Codex 中让 Grok 模型搜索 24h 内 20 条 AI 热帖,再调用飞书 CLI 自动保存到飞书多维表格,固定了推文链接、作者、内容简介、标签、爆点、推荐二创内容六个字段。提示词已公开,可一键复刻。

用 Codex 里的 Grok 模型批量抓 X 热帖,再自动存进飞书多维表格,做选题库的可以直接抄提示词跑一遍。

点击打开原文,能否访问取决于网络环境

作品与案例

Works

Dreamina Seedance 2.0 4K 生成 13…

导演尼尔·布洛姆坎普用Dreamina Seedance 2.0 4K纯文本生成了科幻恐怖短片《Nightborne》,以伪纪录片形式呈现,每帧均由提示词驱动,使用了32人的授权肖像与声音。布洛姆坎普称这是长片测试,并预期Seedance 2.5将带来质的飞跃。

尼尔·布洛姆坎普用纯文本提示词驱动整部短片,32人授权肖像与声音,做AI长片和短剧的可以直接拉片看叙事节奏和角色一致性处理。

点击打开原平台查看,能否访问取决于网络环境

阿里云WAIC AI视频创作赛获奖作品发布

阿里云在 WAIC 期间主办 AI 视频创作者马拉松,公布首个获奖作品,完全使用其自研 AI 视频生成模型 Happyhorse 制作。官方强调该短片在角色一致性和画面细节上表现突出,作为国产模型在叙事场景的落地案例。

阿里云自家视频模型 Happyhorse 的 WAIC 马拉松获奖短片,做 AI 短剧的可以拉片看角色一致性和细节表现,验证国产模型在叙事场景的落地水平。

点击打开原平台查看,能否访问取决于网络环境

Kimi K3 复刻知名动效视频,还原度极高

HyperFrame 团队用 Kimi K3 复刻了一个知名动效设计师团队的标志性动效视频,还原度极高。该动效团队风格独特、制作难度大,此前曾声称 Kimi K3 无法完成此类视频。HyperFrame 团队后续还发布了复刻过程解析。

Kimi K3 被拿来硬刚知名动效团队的标志性视频,还原度还很高,视觉师和后期可以直接拉片看动效细节和风格一致性处理水平。

点击打开原平台查看,能否访问取决于网络环境

A whole cast that acts like it…

LumaLabsAI 官方发布创作者 Joana Haars 的 AI 短片,主题聚焦角色群像,强调角色在叙事中的独立存在感。短片使用 Luma 工具制作。

Luma 官方发的 AI 短片,角色群像感强,做 AI 短剧和视觉的可以拉片看角色一致性和群戏调度。

点击打开原平台查看,能否访问取决于网络环境

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索