← 全部日报

AIGC 信息日报

2026 年 9 月 19 日 周六

行业与平台

Industry

阿里官方介绍 Qwen3.8-Omni-Flash 全模态模型

阿里云官方介绍 Qwen 首个围绕智能体能力构建的全模态模型 Qwen3.8-Omni-Flash(该产品 9 月 18 日已发布),把音视频理解、推理和工具调用整合在同一个模型中。官方定位是面向智能体场景,而非单纯的生成模型。对做自动化剪辑、素材批量理解与处理的团队来说,这类能直接调工具的全模态模型值得关注其 API 接入方式。

阿里云首个围绕智能体能力搭的全模态模型,音视频理解、推理、工具调用塞进一个模型里,做自动化剪辑和素材批处理的可以接 API 试一周。

点击打开原文,能否访问取决于网络环境

xAI 发布 Grok Voice Transcribe 2.0 转写模型

xAI 发布语音转文本模型 Grok Voice Transcribe 2.0,官方称准确度是 1.0 的两倍且价格不变,基于 Grok Voice 背后的音频基础模型,训练数据为多语言、嘈杂环境下的真实录音。官方称其在 Artificial Analysis 公开榜单的 32 个流式模型中准确率排第一,并针对电话线路杂音、多人抢话、口音、念电话号码和邮箱等难处理场景做了优化。该模型已用于每天数万通客服电话、数百万小时视频旁白转写,以及特斯拉车内 Grok 助手的语音交互。

转写准确度翻倍、价格不变,官方称在 Artificial Analysis 32 个流式模型里准确率排第一。做字幕、访谈整理、短剧对白的后期可以接 API 跑一周,看嘈杂环境下的实际表现。

点击打开原文,能否访问取决于网络环境

Video Rebirth 开源 H3 HyperFlow 蒸馏技术

Video Rebirth(@video_rebirth)宣布开源 H3 HyperFlow,一种基于 MiniMax H3 构建的无数据流自蒸馏技术,无需外部训练数据,官方称在保持前沿模型质量的同时显著降低推理成本,完整 demo 已在其官网发布。对做批量视频生成的团队来说,这类蒸馏方案直接关系到单条成片的算力开销,值得实测验证画质损失与成本下降的实际比例。

基于 MiniMax H3 的无数据自蒸馏方案,宣称不牺牲画质就能压低推理成本,跑批量视频的团队可以拿 demo 测一下出片成本能降多少。

点击打开原平台查看,能否访问取决于网络环境

Runway 公布过去 18 天发布项目

Runway 创始人 Cristóbal Valenzuela 列出公司过去 18 天发布的项目:Runway Ruby、Runway Dev MCP、Solaris、GWM Worlds 2、Team Plan、Adobe 插件、Model Licensing、Enhance Frame Rate,以及 Ruby 的 Alpha 通道支持。这是一份官方口径的更新汇总,覆盖模型、开发接口、插件和后期功能多个方向。

Runway 创始人自己列的 18 天更新清单,Ruby、Dev MCP、Solaris、Adobe 插件、帧率增强都在里面,做后期的可以对着清单查自己漏了哪个。

点击打开原平台查看,能否访问取决于网络环境

Grok Imagine Image 2.0 文生图榜升至第 4

Artificial Analysis 评测显示,xAI 的 Grok Imagine Image 2.0 在其文生图榜单排第 4,是 OpenAI 之外排名最高的模型,较上一代从第 18 名上升 14 位,且处于质量与价格的 Pareto 前沿。榜单排名和性价比位置是这条的核心信息,做视觉开发和出图的可以据此判断是否值得纳入备选模型池。

xAI 文生图从第 18 名跳到第 4,是 OpenAI 之外排名最高的模型,还卡在质量与价格的性价比前沿。做视觉开发和 KV 出图的可以拿它跟手头模型对比着测一轮。

点击打开原平台查看,能否访问取决于网络环境

Pocket FM 推出 AI 连载小说助手 Sherpa

Pocket FM 推出面向连载小说的 AI 写作助手 Sherpa,Beta 阶段免费使用,主打长篇故事前后一致性。系统由 Planner、Feedback、Storyboard 三个 Agent 组成,分别负责季度剧情规划、编辑式修改意见和角色设定追踪。

三个 Agent 分工管季度剧情、编辑意见和角色设定追踪,专治长篇前后不一致。做 AI 短剧和连载叙事的可以拿它试剧本长线规划。

点击打开原平台查看,能否访问取决于网络环境

工具与能力

Tools

Runway 统一计价:credits 打通网页端与 Dev

Runway 官方宣布在平台内推出统一计价,所有购买的 credits 现在可在网页应用和 Runway Dev 两处通用,一次购买即可覆盖两种使用方式,同时上线了配套的新优惠。对同时用网页端做创作、用 Dev 跑批量任务的团队来说,额度不再分池,采购和成本核算可以合并处理。

Runway 把网页端和 Runway Dev 的 credits 打通,一次购买两边都能用,还配了新优惠。做短剧和批量出片的制片可以算一下账,看能不能省掉分开充值的麻烦。

OpenClaw 推出多人协作模式,团队共享会话

OpenClaw 发布 Multiplayer Mode,主打解决「meat proxy」问题——让团队直接在共享会话里协作,而不是靠人转述 AI 输出。功能包括实时共享会话、UI mockup 与 @ 提及、权限与安全、团队可见性与交接、Prompt 请求、共享仪表盘。演示视频中 Josh Lehman 与另一位维护者用这些功能搭了一个内容仪表盘,并聊到「multi-claw」构想以及能否取代 Slack。

OpenClaw 加了多人共享会话、@ 提及、权限交接和共享仪表盘,团队不用再靠人转述 AI 的输出。带团队跑 AI 工作流的可以看看这套协作方式能不能替掉现在的群聊加截图。

点击打开原平台查看,能否访问取决于网络环境

Gemini 3.8 演示:出声推理引导搭建工作坊助手

Google AI for Developers 发布 demo:用 Gemini 3.8 Live Extended Thinking 做一个工作坊助手,能分析用户的工作区画面、出声推理,并引导用户完成整个搭建过程,定位是「零经验也能搭出第一个赛博终端」。展示的是实时视觉理解加语音推理的组合能力,面向实时交互类应用场景。

Google 官方放出的 Gemini 3.8 Live Extended Thinking demo,边看工作区边出声推理、一步步带人搭东西。做虚拟角色对话和实时语音交互的可以看看这套「边看边说」的节奏怎么走。

点击打开原平台查看,能否访问取决于网络环境

腾讯 WorkBuddy 5.5.6 上线全栈网页应用生成

腾讯 WorkBuddy 5.5.6 上线全栈「应用」生成能力,首期支持全栈网页应用生成:自带云数据库(结构化数据增删改查、权限规则)、文件存储(图片附件上传调用)、注册登录(内置身份认证、数据按用户隔离)和免密钥 AI 调用(不用自己申请管理 API Key),免部署、发布即得访问链接,并提供运营数据统计。会员权益同步调整,新增资料库存储空间(免费用户累计 5G)和云服务资源点额度,应用开启云服务后按访问人数和使用情况消耗资源点。

WorkBuddy 把云数据库、文件存储、注册登录和免密钥 AI 调用打包进网页应用生成,发布即得访问链接。做互动短剧、粉丝投票页、作品展示站的团队可以拿它搭个轻量工具,不用再找后端。

点击打开原文

YouMind 接入飞书,可在飞书内读写云文档

YouMind 官方宣布支持接入飞书,可在飞书内发送文件、读写云文档,并通过 @Sprite 分配下一项任务,无需离开飞书即可推进工作。对做团队协作、素材与文档管理的创作者来说,这是把 AI 助手嵌进日常办公流程的一次集成,具体能力边界和权限范围需在飞书内实际接入后确认。

YouMind 支持在飞书里发文件、读写云文档、@Sprite 派任务,做团队协作和资料整理的可以接上试试,看能不能省掉来回切工具的功夫。

点击打开原平台查看,能否访问取决于网络环境

方法与经验

Methods

ComfyUI 工作流:概念图转 3D 再出任意角度镜头

ComfyUI 上一条概念图转任意角度的动画工作流,3D 生成环节由 Tripo 完成。流程分三步:概念图经 Tripo 生成并保存为 GLB 模型;静止画面用 Load 3D 输出视角后由 GPT Image 2 渲染成同风格插画;镜头运动在视口中录制路径,作为 Seedance 2.0 的运动参考生成镜头。文末附工作流运行链接。

概念图先经 Tripo 转 GLB 模型,再用 GPT Image 2 渲染同风格插画、Seedance 2.0 做镜头运动,一条工作流把静态设定图变成可换角度的镜头。做视觉开发和分镜的可以照着跑一遍。

点击打开原平台查看,能否访问取决于网络环境

GPT-6 Astra × Blender × Dreamina 全流程拆解

Dreamina AI 官方账号发布创作者 @manuelpeterCGI(Pwnisher Challenge 获胜者、Dreamina AI 3D Reference Creative Contest 评委)的完整工作流拆解:从单条 GPT-6 Astra 提示出发,在 Blender 中搭建 3D 场景,再用 Dreamina AI 插件配合 Seedance 2.5 渲染出成片级视频。他给出的经验包括:Seedance 2.5 写实渲染只需几分钟、可自由添加人物和道具;有时删掉参考图反而更真实;给模型更多故事背景信息更容易走对方向;简化 3D 白模能换来更自然的动作;以及把已生成的 AI 视频当作新一轮提示的参考视频。

Pwnisher 挑战赛获奖者把从一句提示到 Blender 搭景、再用 Dreamina 插件出片的完整流程拆开讲,还给了「删参考图反而更真实」「把生成视频当新参考」这类实操经验,做 3D 转 AI 视频的可以照着跑一遍。

点击打开原平台查看,能否访问取决于网络环境

Diffusion Studio 全自动生成发布视频,项目开源

作者称整支发布视频完全由 Diffusion Studio 生成,全程没有手动操作时间线,视频观看量超过 45 万次,且该项目完全开源,可自行拆解使用。对做后期和自动化剪辑的创作者来说,这是一条把剪辑流程交给代码跑的实操样本,可拆源码研究其自动生成方式。

整支发布视频没碰过一次时间线,全靠 Diffusion Studio 生成,项目还完全开源。做后期和自动化剪辑的可以拆源码看它怎么把剪辑流程交给代码跑。

点击打开原平台查看,能否访问取决于网络环境

OpenRouter 实测 20 个图像模型:单张成本差 22 倍

OpenRouter 用相同提示词实测其路由的 20 个图像生成模型,对比计费、编辑能力和出图质量,单张图片成本区间为 $0.006 至 $0.134,最高与最低相差 22 倍。对需要批量出图的团队来说,这份横评可以直接当选型参考,按单张成本和质量权衡该接哪个模型。

同一提示词跑 20 个图像模型,单张从 $0.006 到 $0.134,做批量出图的制片和视觉师可以拿这张价目表挑性价比。

点击打开原文

GPT-6 Astra 通过 MCP 接入达芬奇

推文称 GPT-6 Astra 通过 MCP 接入 DaVinci Resolve,作者 @ForwardEditor 同时附了一条 44 秒的视频演示。原文只有这一句描述加视频,没有给出具体配置步骤、MCP 服务端写法或达芬奇版本要求。对后期和剪辑岗来说,这是把大模型能力直接挂进剪辑软件的一次尝试,值得看视频确认实际能调用的操作范围。

有人把 GPT-6 Astra 用 MCP 接进了达芬奇,剪辑台里直接调模型。做后期的可以顺着这条摸一下 MCP 接法,看能不能塞进自己的调色/剪辑流程。

点击打开原平台查看,能否访问取决于网络环境

PixVerse 联手 Astra 与 Blender 做动作场景

PixVerse 官方发布一条工作流演示:用 Astra 规划镜头运动,再由 PixVerse 渲染出动作场景成片,Blender 参与其中。官方称这套组合是「动作场景的疯狂组合」。对做动作戏和镜头调度的创作者来说,这是一条可参考的分工思路——镜头运动交给规划工具、渲染交给视频模型。

官方演示了 Astra 规划镜头运动、PixVerse 出片的分工,做动作戏和镜头调度的编导可以顺着这条思路试一遍。

点击打开原平台查看,能否访问取决于网络环境

Ethan Mollick 让 Claude 自主选题并做出一部讲解影片

Ethan Mollick 给 Claude 下了一条开放式指令:挑一个让你着迷的问题或谜团,尽力解决,并做一部能在社交媒体分享的影片。Claude 选了伏尼契手稿尝试破解但失败,随后产出了一部影片,Mollick 评价其观感不错、也是一部合格的讲解片。这条展示的是把选题、研究、成片串成一条指令交给模型自主完成的用法。

沃顿教授给 Claude 一句开放式指令,让它自己挑谜题、尝试破解、再做成可分享的影片。做 AI 短片和自动化内容流程的可以看看这种「一句话交给 Agent 全流程」的玩法。

点击打开原平台查看,能否访问取决于网络环境

作者用 PixVerse 同提示词生成两版对比

创作者用 PixVerse 做了一组对照测试:同一模型、同一提示词、同一图像参考下,分别生成「Detailed」和「Super Simple」两版,成片用三个镜头节拍——居中推近、跟随取耳机动作的侧面特写、回到正面拉出。作者先修正了场景本身:早期布景把拥挤的火车处理成一排安静坐着的人,角色行为也过于刻意,于是把动作改成从包里取出耳机而非开场就拿着。结论是细节版动作更僵硬,但作者明确表示这不能证明细节本身导致僵硬,也不代表简单版总是更好。

作者用同一模型、同一提示词、同一参考图跑出「细节版」和「极简版」两版,发现细节多的那版动作反而更僵硬。做 AI 短片调表演的可以拉片看这个对比。

点击打开原平台查看,能否访问取决于网络环境

创作者称 PixVerse 恐龙场景 2.5 效果优于 2.0

创作者用 PixVerse 制作「错误楼层」电梯遇恐龙场景,复盘第一版问题:机位角度没交代清楚镜头该展示什么、序列缺乏张力、恐龙 CG 感明显。修改方案是重做 Blender 相机与空间布局,把森林留在电梯外,只用恐龙外观参考图,保留喜剧与威胁的反差。作者同时放出 2.5 与 2.0 两版结果对比,并指出提示词指南修正后模型理解仍有差异。

作者把「错误楼层」这场戏的翻车点摊开讲:机位没交代清楚、恐龙一眼假、空间关系乱。做 AI 短片和分镜的可以看他怎么用 Blender 重搭相机和空间,以及 2.5 与 2.0 同一提示词下的差距。

点击打开原平台查看,能否访问取决于网络环境

创作者实测 H3 提示遵循:换角色保动作很难调

创作者 @AIWarper 实测 H3 的提示遵循能力,指出它做「替换角色但逐字匹配所有动作」这类基础任务时非常挑剔,另外叠加任何类型的 turbo lora 都会让控制难度显著上升,明确建议不要这么做。

做角色替换和动作复刻的可以留意这条踩坑记录:H3 提示遵循很挑,加 turbo lora 后更难控,先别急着上加速方案。

点击打开原平台查看,能否访问取决于网络环境

作品与案例

Works

B站 AI MV 大赛作品《篡改正史》最高列全站第36

B 站 AI MV 大赛参赛作品《篡改正史 / 正史改竄》,主题为对篡改历史行为的讽刺,标注含 AI 生成内容,曾登全站排行榜最高第 36 名。作品以 MV 形式呈现,画面与音乐结合,属于 AI 音乐影像类创作。做 AI MV 和音乐影像的可以看它的画面与歌词节奏配合方式。

AI MV 大赛参赛作品,历史讽刺题材,全站排行最高第 36 名。做 AI 音乐影像和 MV 的可以拉片看画面与歌词的配合节奏。

点击打开原平台查看

AI 怪谈惊悚剧《雨夜之下》更新第八集

B 站「全民AI制作人」系列原创怪谈惊悚剧《雨夜之下》第八集,本集交代多条线索:宿管王阿姨身份真假、官方势力介入、大运哥受邀成为学校司机、周泽变成雨夜傀儡后能打游戏、校内反派酝酿阴谋、狐子撞破食堂秘密、黑色雨衣人疑似被人饲养。作者自述本集仍无吓人场景、信息交代偏多。

B 站「全民AI制作人」系列的怪谈惊悚短剧第八集,走的是多线铺陈、逐集放线索的路子,做 AI 短剧的可以拉片看它怎么用低成本画面撑住连续剧的悬念节奏。

点击打开原平台查看

AI复刻邪恶迪迦娘双语字幕短片

B站 UP 主发布的 AI 复刻长篇,融合正剧《地中鲨鱼》与《影的继承人》两集剧情,配双语字幕。邪恶迪迦娘德语台词选自尼采《查拉图斯特拉如是说》前言,配乐按段落调度:索尔蒂版瓦格纳《纽伦堡的名歌手》用于登场段落,坂本龙一《Dream》配午夜游乐园对白,Toby Fox《Undertale》原声配地下遗迹对白,Boards of Canada《Beware The Friendly Stranger》配林中片段。

个人创作者把《地中鲨鱼》和《影的继承人》两集剧情揉成一部长篇,德语台词直接引尼采原文,配乐从瓦格纳排到坂本龙一。做 AI 长叙事的可以拉片看它怎么用配乐切段落。

点击打开原平台查看

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索