← 全部日报

AIGC 信息日报

2026 年 9 月 27 日 周日

行业与平台

Industry

微软发布基于 OpenClaw 的常驻智能体 Autopilot

微软宣布推出 Autopilot,一个基于 OpenClaw 构建的常驻智能体。OpenClaw 官方称,此次合作中最值得关注的是微软的 Omar Shahine 及其团队向 OpenClaw 回馈了大量贡献,具体内容见 openclaw.ai 博客。对做自动化工作流的团队来说,这是常驻型智能体被大厂产品化的一次落地,可关注其与 OpenClaw 生态的接入方式。

微软把 OpenClaw 做成常驻智能体 Autopilot,还反向给 OpenClaw 回馈了不少代码。自己搭自动化流程的可以点进博客看它怎么接。

Sarvam AI 发布 Saaras V4 语音转写模型

Sarvam AI 发布语音识别模型 Saaras V4,覆盖全部 22 种印度表列语言并新增全球英语口音,官方称在 22 种语言上均达 SOTA 准确率。架构为编码器-解码器:音频编码器提取音素与声学特征,经时间下采样适配器压缩后送入自研 3B 参数混合状态空间语言模型 Sarvam-3B 自回归输出转写。今日起可通过 API 调用(model="saaras:v4"),SageMaker 自托管文档目前仅覆盖 v3。英语侧在 AMI、GigaSpeech、LibriSpeech、SPGISpeech、VoxPopuli 及 AI4Bharat 的 Svarah 共 7 个数据集上评测,平均 WER 为所测模型中最低。

覆盖 22 种印度语言加全球英语口音,API 直接调 saaras:v4,做多语种字幕和配音的后期可以接上测一轮 WER。

点击打开原文

OpenRouter 上线 Jev Router 自动选模型与推理力度

Jev 以 typesafe/jev-router 形式打包上线,把对话发给它,OpenRouter 会为每个请求自动挑模型和推理力度。作者用 Pi SDK 搭的支持智能体做对比:同样 8 个案例、共 32 次真实调用,路由版与固定 GPT-6 Sol 基线全部答对,成本 $0.008 对 $0.018,中位响应 1.5s 对 1.9s。作者提到缓存问题尚未完全解决。

自建 Agent 流程的团队可以看:同一批 8 个用例跑 32 次真实调用,路由版成本 $0.008、固定 GPT-6 Sol 基线 $0.018,中位响应 1.5s 对 1.9s,两边全答对。样本小,但批量跑任务的可以自己接上测一周。

工具与能力

Tools

GPT-6 astra 用 PixVerse 插件把梗图变功夫动画

PixVerse 官方演示:在 ChatGPT 中调用 PixVerse Plugin,把 doge vs pepe 梗图转成一段功夫动画,官方称无需任何动画技能。演示基于 GPT-6 Astra 环境。适合做梗图二创、社媒短视频的团队测试图生动画的批量出片效率。

在 ChatGPT 里装个 PixVerse 插件,丢张 doge vs pepe 梗图就能出功夫动画,不用会动画。做短视频和社媒内容的可以拿它试批量出片。

点击打开原平台查看,能否访问取决于网络环境

方法与经验

Methods

@rexan_wong 分享 Opus 5.5 动态图形视频制作流程

作者 @rexan_wong 拆解了用 Opus 5.5 生成动态图形视频的完整流程:第一步从 whatships.com 找 1-2 条风格参考片,直接让 Opus 照着匹配——点名风格比描述风格有效得多,没有参考时 Opus 会退回居中文字+渐变背景+全部淡入的默认样式,这也是大量视频长得一样的原因;第二步装 HyperFrames 或 Remotion,让 Opus 把每个场景写成代码直接渲染成 mp4,不用剪辑软件,改一处只重渲一行而不是从头再来;第三步装 21st_dev 拿现成的高质量按钮、卡片和 UI 组件,替代 Opus 现场瞎画。

作者实测发现「一个提示出片」多半是平庸货,真正管用的是先找参考片让 Opus 照着抄节奏和转场,再装 HyperFrames 或 Remotion 让它把每个场景写成代码直接渲染成 mp4。做动态图形和片头包装的可以照这套跑一遍。

点击打开原平台查看,能否访问取决于网络环境

宝玉用 Claude Code 加 Opus 5.5 生成 Transformer 讲解视频

宝玉(@dotey)分享用 Claude Code + Opus 5.5 制作《什么是 Transformer》讲解视频,公开的提示词要求用 JS 生成视频、深入浅出到高中生能看懂、覆盖注意力机制和数学概念,并允许模型自行安装工具和联网检索。对做知识科普动画和教学短片的创作者来说,这是一条「一句话让 AI 自己写代码出片」的完整可复现样本。

一条提示词让 Claude Code 自己写 JS 做出带注意力机制和数学细节的科普视频,做知识类动画和教学短片的可以照着这个思路跑一遍。

点击打开原平台查看,能否访问取决于网络环境

Claude Opus 5.5 一条提示词生成递归讲解视频

Ethan Mollick 用一条提示词让 Claude Opus 5.5 生成解释递归的视频,要求每次解释递归都切换截然不同的视频风格,做到自指、巧妙、节奏快,最终实现九次风格切换;随后他又测试了一个真正具有教育性的版本,模型在保持多风格约束的同时,用有趣易懂的方式讲清了编程意义上的递归。

一条提示词跑出九次风格切换的讲解视频,还带自指结构,做知识类短视频和分镜节奏的可以拿这个思路试一遍。

点击打开原平台查看,能否访问取决于网络环境

@lexx_aura 称 Pollo MCP 让 AI 短片制作更易上手

创作者 @lexx_aura 分享用 Pollo MCP 串起 AI 短片制作流程:Claude 负责故事与导演方向,GPT Image 2.5 生成角色和分镜,Seedance 2.5 做视频生成,Pollo AI MCP 负责把这几步连起来。作者称过去做短片要处理首帧、角色一致性、反复改提示词和手动拼接剪辑,现在只需描述概念。

把 Claude 写故事、GPT Image 2.5 出角色分镜、Seedance 2.5 生成视频串成一条流程,做短剧和短片的技术整合者可以照着搭一套试试。

点击打开原平台查看,能否访问取决于网络环境

Qwen3.8-Omni-Flash 报告:百万 token 全模态智能体

@dair_ai 转述 Qwen3.8-Omni-Flash 技术报告,这是一个原生多模态模型,面向跨文本、音频、视频的长程智能体任务,点名的用例包括视频编辑和长音频视频翻译。模型沿用 Qwen3.8-Next 的稀疏 MoE 架构,上下文窗口达一百万 token,通过协同训练策略在保持文本性能的同时把智能体能力迁移到音频和视频任务上。目前是报告阶段,具体开放方式和调用接口尚未在原文中说明。(该产品 9 月 18 日已发布)

百万 token 上下文 + 音频视频长程任务,视频编辑和长音频翻译是明确用例,做后期和自动化流程的可以盯一下后续有没有 API 放出来。

点击打开原文,能否访问取决于网络环境

作者让Astra用Chat远程操控本地Blender建模

日本用户 @umiyuki_ai 分享:通过 Secure MCP Tunnel 功能,从网页版 ChatGPT(Chat,非 Codex)经 MCP 协议远程操作本地 PC 上的 Blender,一次提示连续工作 42 分钟,完成一座昭和时代日本房屋的建模。作者提到 Pro 200 美元套餐每周约可进行 200 次 Pro 对话。对做 3D 场景、美术资产和自动化建模流程的创作者,这是一条把大模型接到本地 DCC 软件的实操样本。

作者用 Secure MCP Tunnel 让网页版 ChatGPT 直接操作本地 Blender,一次提示跑了 42 分钟建出昭和日式房屋。搞 3D 场景和美术资产的可以研究这套远程操控本地软件的接法。

点击打开原文,能否访问取决于网络环境

作者开源 39 种风格视频库,用 Opus 5.5 稳定出片

作者 @lemomo_ai 分享用 Claude Opus 5.5 做视频的经验:前后做了 100 多支,挑出 39 支各代表一种风格(水墨、皮影、油画厚涂、80 年代赛璐璐、像素 RPG 等),整理成一个开源风格视频库,并总结如何用 Opus 5.5 稳定出片。对做视觉开发和风格探索的创作者,这是一份可直接参考的风格样本集与出片经验。

作者用 Claude Opus 5.5 做了 100 多支视频,挑出 39 支各代表一种风格(水墨、皮影、油画厚涂、80 年代赛璐璐、像素 RPG 等)整理成开源库,做视觉开发和风格探索的可以拿来当参考集。

点击打开原文,能否访问取决于网络环境

Soran 分享第一人称仙侠御剑短片 prompt

作者公开一条 15 秒中文对白仙侠御剑短片的完整 prompt,严格锁定男主第一人称 POV,机位高度约 178cm,全程不切第三人称、不用漂浮摄影机,走路起伏、坠落、踩剑、重心修正都要求符合真人身体惯性。环境按参考图固定白玉云桥与深色木构仙宫群,人物 ID 全程锁定同一东亚女性、同一造型不换装。叙事按 0-3 秒扔剑、3-6 秒起跳、6-11 秒首次御剑成功分段写死,御剑飞行从第 6 秒持续到结尾。

一条把 POV 御剑拍法写透的 prompt:身高 178cm 视角、不切第三人称、不飘机位、身体惯性怎么走都标了秒数。做仙侠短剧和第一人称叙事的编导可以逐段抄结构。

点击打开原平台查看,能否访问取决于网络环境

M5 Ultra Mac Studio 实测:本地跑 AI 智能体提速 150%

MacStories 作者对 256GB 内存的 M5 Ultra Mac Studio 做了四天评测,测得提示词处理速度比 M3 Ultra 平均提升约 150%,Qwen3.8-Flash-Next 短提示词生成超过 100 tok/s,256K 长上下文下仍保持 60-85 tok/s。对需要本地跑大模型、搭私有智能体工作流的团队,这组数据可作为选型参考。

256GB 内存的 M5 Ultra 跑本地大模型,提示词处理比 M3 Ultra 快约 150%,256K 上下文还能维持 60-85 tok/s。想搭本地智能体、不想按 token 付费的团队可以看这份四天实测数据。

点击打开原文

brumar 开源 Claude Code 棋局复盘 Skill

作者 brumar 开源一套 Claude Code skills,输入 lichess 对局链接和本人思考录音 mp3,用 whisper.cpp 本地转写,再按 PGN 里的走棋时钟把每句话匹配到当时正在思考的那一步,结合 Stockfish 引擎生成可读的复盘报告和带英文旁白、字幕的解说视频,示例素材(转写、引擎分析、标注 PGN、分镜)全部放在 examples/game-010/ 目录。

把「录音+时间戳对齐+自动解说」这套做法搬到影视复盘上完全可行,做幕后花絮和导演解说的后期可以拆一下它的对齐逻辑。

点击打开原文

作品与案例

Works

大明14444:带失落千年古城重返珀泠星

B站 UP 主「星海大明锦衣卫AIGC」的 AI 系列短剧《大明14444》,以「大明+星际」混搭世界观展开,单集 1-,已更新数十集,涵盖星舰交易、书院日常、遗迹探索、门派武试等支线,另有「AI全民制作人」子系列。做 AI 短剧的可以看它如何用固定角色和连续世界观做长线连载。

B站 UP 主「星海大明锦衣卫AIGC」的 AI 系列短剧,单集 1-、已更新数十集,做 AI 短剧的可以拉片看它怎么用固定角色和世界观撑起长线连载。

点击打开原平台查看

B站UP主用AI还原皮可vs克巳打斗片段

B站UP主用AI还原《刃牙》中皮可对克巳的部分打斗场面,作者自述本期制作难度较高,属动作向AI短片。做格斗、动作题材的编导和视觉可以看打斗节奏与镜头处理。

《刃牙》皮可对克巳的打斗还原,动作向AI短片,做格斗/动作题材的可以拉片看打斗节奏和镜头处理。

点击打开原平台查看

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索