Sarvam AI 发布语音识别模型 Saaras V4,覆盖全部 22 种印度表列语言并新增全球英语口音,官方称在 22 种语言上均达 SOTA 准确率。架构为编码器-解码器:音频编码器提取音素与声学特征,经时间下采样适配器压缩后送入自研 3B 参数混合状态空间语言模型 Sarvam-3B 自回归输出转写。今日起可通过 API 调用(model="saaras:v4"),SageMaker 自托管文档目前仅覆盖 v3。英语侧在 AMI、GigaSpeech、LibriSpeech、SPGISpeech、VoxPopuli 及 AI4Bharat 的 Svarah 共 7 个数据集上评测,平均 WER 为所测模型中最低。
为什么值得看:覆盖 22 种印度语言加全球英语口音,API 直接调 saaras:v4,做多语种字幕和配音的后期可以接上测一轮 WER。
有用户称谷歌已免费开放 Gemini Omni 视频生成:任何拥有谷歌账号的人都能生成 1080p 视频,无需订阅,可控制场景时长、转场、使用模板,全程在浏览器内完成,入口为 vids.google.com。该消息来自个人账号转述,非谷歌官方公告,具体开放范围与限制需自行登录验证。
为什么值得看:任何谷歌账号都能免费用 Gemini Omni 出 1080p 视频,还能控时长、加转场、套模板,做短剧和广告的这周拿浏览器跑几条看废片率。
Gemini 3.8 Live 新增 Live Avatar 功能(该产品 9 月 17 日已发布),把实时对话能力和低延迟流式视频生成原生结合,实现带动态视觉形象的实时交互:精确口型同步、自然表情、流畅的对话轮次切换。该功能即日起在 Gemini Enterprise 中可用,官方展示了多种不同外观、声音和表现力的角色。适用于客服、交互式导览等企业场景。做虚拟角色、数字人对话和实时交互内容的团队可以关注其口型与表情同步的实际表现。
为什么值得看:实时视频生成配上语音对话,口型、表情、轮次切换都做了,做虚拟角色和数字人客服的可以接进 Gemini Enterprise 试一周。
Motion(@motion_so)发布面向动效设计的 GPT-6 集成:用户提供想法、素材和视觉参考后,通过 Motion MCP 可自动构建动画场景、排版与过渡效果,并生成多个可继续编辑的版本;用自然语言描述修改需求,GPT-6 会在 Motion 内直接更新视频。
为什么值得看:给想法、素材和视觉参考,GPT-6 通过 Motion MCP 直接生成动画场景、排版和转场,还能用一句话改片。做后期和动效的可以上手试试这套改片方式。
作者公开一条 15 秒中文对白仙侠御剑短片的完整 prompt,严格锁定男主第一人称 POV,机位高度约 178cm,全程不切第三人称、不用漂浮摄影机,走路起伏、坠落、踩剑、重心修正都要求符合真人身体惯性。环境按参考图固定白玉云桥与深色木构仙宫群,人物 ID 全程锁定同一东亚女性、同一造型不换装。叙事按 0-3 秒扔剑、3-6 秒起跳、6-11 秒首次御剑成功分段写死,御剑飞行从第 6 秒持续到结尾。
为什么值得看:一条把 POV 御剑拍法写透的 prompt:身高 178cm 视角、不切第三人称、不飘机位、身体惯性怎么走都标了秒数。做仙侠短剧和第一人称叙事的编导可以逐段抄结构。
Suno 官方介绍案例:舞者 @braylonbrowner 用 Suno v6 把自己的舞蹈动作变成一首歌,并据此完成首支音乐视频,由 Nina McNeely 执导,成片在 suno.com/braylon 可看(该产品 9 月 10 日已发布)。这条展示的是「动作作为音乐起点」的创作路径,而非单纯用文字提示生成配乐。做 MV、舞蹈影像、音乐短片的团队可以关注动作与音乐生成之间的对应关系。
为什么值得看:Suno 官方展示舞者 @braylonbrowner 用 v6 把编舞动作转成音乐,成片由 Nina McNeely 执导。做 MV、舞蹈影像和音乐短片的可以看看动作驱动音乐这条新玩法。
X 用户 Thariq(@trq212)用 MAX 订阅让 Opus 5.5 批量生成个人网站重设计方案,通过工作流让模型自我迭代和批判,最终方案命中了他想要的调性;随后他又让模型把整个迭代过程做成一支预告片。属于个人使用体验分享,展示了用工作流驱动模型自我批判、并把过程素材二次加工成视频的思路。
为什么值得看:用工作流让模型自己迭代+批判设计方案,再把迭代过程剪成预告片,做视觉开发和提案演示的可以看看这套「让 AI 自己挑刺」的玩法。
Luma AI 官方博客发布 AI 打光提示词专题,按黄金时刻、硬光、实景光源(practicals)、霓虹四类光线风格整理提示词写法,面向 AI 图像/视频生成中的光线控制场景。原文仅给出标题,未展开具体提示词文本与示例图。做视觉开发和分镜的可以按这四类光线建立自己的打光词库,跑图时逐类对比出片效果。
为什么值得看:Luma 官方博客把黄金时刻、硬光、实景光源、霓虹四类打光写成提示词模板,做视觉和分镜的可以存下来当打光词库用。
B站 UP 主「星海大明锦衣卫AIGC」的 AI 系列短剧《大明14444》,以「大明+星际」混搭世界观展开,单集 1-,已更新数十集,涵盖星舰交易、书院日常、遗迹探索、门派武试等支线,另有「AI全民制作人」子系列。做 AI 短剧的可以看它如何用固定角色和连续世界观做长线连载。
为什么值得看:B站 UP 主「星海大明锦衣卫AIGC」的 AI 系列短剧,单集 1-、已更新数十集,做 AI 短剧的可以拉片看它怎么用固定角色和世界观撑起长线连载。
B 站 UP 主「无烬映画」的 AI 动画系列《龙之使徒》第五集《离别》,投稿至 HiShorts! × updream AI 短片大赛剧情单元,属传统王道征途题材,系列已更新至第五集。评论区反馈集中在打戏段落,认为动作戏是本集看点。
为什么值得看:王道征途题材的 AI 动画系列第五集,评论区集中夸打戏,做 AI 动画和短剧的可以拉片看它的动作戏和系列化更新节奏。
B 站 UP 主「旋转皮坨」发布的 AI 短剧《道士也怕鬼》第九集,属「AI 全民制作人」系列,题材为道士捉鬼向的剧情短剧,已更新至第九集,说明是持续连载的系列作品。做 AI 短剧的可以拉片看它多集连载下的人物一致性和叙事节奏处理。
为什么值得看:B 站 UP 主「旋转皮坨」的 AI 短剧系列更新到第九集,做 AI 短剧的可以拉片看它怎么处理连续剧集的人物一致性和节奏。
B 站 UP 主 foooga 的原创 AI 悬疑恐怖短剧《野佛》,本次更新第五幕「逃亡」,属分幕连载形式,题材为悬疑恐怖向,看点在于个人创作者用 AI 做连续剧集的分幕叙事与氛围营造。
为什么值得看:个人创作者连载的 AI 悬疑恐怖短剧,已更到第五幕,做 AI 短剧的可以拉片看它怎么用分幕结构撑住连续叙事和恐怖氛围。