← 全部日报

AIGC 信息日报

2026 年 8 月 4 日 周二

行业与平台

Industry

OpenAI 详解 GPT-Live 实时语音系统架构

OpenAI 官方博客详解 GPT-Live 实时语音系统,核心是 turnless 语音模型(无需等待对方说完即可响应)配合低延迟架构,实现更自然、更快的连续语音交互。文章披露了从零搭建这套系统的六个月工程路径,涉及流式处理、中断处理等关键设计。对 AI 配音、虚拟角色对话、实时字幕等场景有直接参考价值。

OpenAI 官方拆解 GPT-Live 的 turnless 语音模型和低延迟架构,做 AI 配音、虚拟角色对话、实时字幕的后期和短剧团队可以照着这套思路评估自己的链路。

点击打开原文

海螺AI发布开源视频模型,支持RTX 5090本地运行

海螺AI(@Hailuo_AI)官方宣布发布一款开源权重视频生成模型,面向社区,并已验证可在RTX 5090和RTX 6000等消费级/专业级GPU上本地运行。官方强调“来自社区,回馈社区”,主打开放与可本地部署。具体模型名称、参数量、生成分辨率与时长等细节未在推文中披露。

海螺AI官方宣布开源视频模型,明确验证可在RTX 5090和RTX 6000上本地运行。做AI短剧和视觉的团队可以蹲权重下载,本地跑通后批量出片成本能压下来不少。

点击打开原文,能否访问取决于网络环境

MiniMax Hailuo 3 上线 Picsart 支持全参考

MiniMax 的 Hailuo 3 模型上线 Picsart 平台,主打 omni-reference(全参考)能力,支持商用级生成。该模型由 MiniMax 提供,集成在 Picsart 编辑工具中,面向图像生成与编辑场景。

MiniMax 的 Hailuo 3 落地 Picsart,主打 omni-reference 和商用级能力,做视觉和短剧的可以上手试角色一致性。

点击打开原文,能否访问取决于网络环境

Higgsfield 办百万美元 AI 电影节,14 个奖项

Higgsfield 官方宣布举办全球 AI 电影节,总奖金 100 万美元,设 14 个奖项,评审含奥斯卡奖评委。同时开源《Hell Grind》《Zephyr》《Mork》三部影片,公开全部 prompt,并发布最佳影片的完整制作拆解。

百万美元奖金池、奥斯卡评委坐镇,做 AI 短剧和长片的团队值得蹲一下参赛规则,顺便把开源的三部片子拉片拆解。

点击打开原平台查看,能否访问取决于网络环境

阿里发布 Qwen3.8-Max,下周开源权重

阿里 Qwen 官方发布 Qwen3.8-Max,定位最强模型,2.4T 参数,主打自主编程能力(10+ 天连续任务)。下周开放权重,同时 Qwen3.8-27B 也将开源。对 AIGC 创作者来说,开源权重意味着可本地部署接入自动化创作流水线,但本次发布聚焦编程能力,与视频/图像生成无直接关联。

阿里最强模型 Qwen3.8-Max 官宣,2.4T 参数主打自主编程,下周权重开源,Qwen3.8-27B 也一并开源。做 AI 工具链整合的可以蹲开源后接进创作流水线。

点击打开原文,能否访问取决于网络环境

AI 虚拟人方桃子广告报价超真人网红

AI 虚拟人物账号「方桃子」起号一个月粉丝突破 40 万,所有视频及本人形象均由 AI 制作。运营方对外广告报价:20 秒视频 16.8 万元人民币,60 秒 25.8 万元,报价远超同粉丝量的真人网红。

AI 虚拟人账号一个月做到 40 万粉,20 秒广告报价 16.8 万、60 秒 25.8 万,比同量级真人网红还贵。做 AI 短剧和虚拟 IP 的可以看看这个商业化样本,验证 AI 形象账号的变现天花板。

点击打开原平台查看,能否访问取决于网络环境

商汤开源轻量统一多模态模型 SenseNova U1.5-Lite-Preview

商汤发布 SenseNova U1.5-Lite-Preview,早期开源预览版轻量级统一多模态模型,基于原生 NEO-Unify 架构,支持跨模态的理解、推理、生成与编辑。官方推文附有链接,具体能力细节和参数需查看原文。

商汤开源轻量级统一多模态模型,原生 NEO-Unify 架构,能跨模态理解、推理、生成和编辑。做视觉和工具链的可以下载跑一遍,看它生成和编辑能力能不能接进现有创作管线。

点击打开原文,能否访问取决于网络环境

dashi-taskboard 开源:任务看板重塑 Codex 工作流

「大师的AI小灶」团队受飞书邀请分享的 Vibe Coding 项目 dashi-taskboard,一套重塑 Codex 工作流的项目管理工具,通过任务看板把用户从海量 Codex 对话中解放出来,项目已在 GitHub 完全开源,可安装体验并提 Issue。

面向 Codex 对话管理的开源任务看板工具,做 AI 编程和 Agent 工作流编排的可以装来试试,看能不能把多线程对话理清楚。

点击打开原平台查看,能否访问取决于网络环境

工具与能力

Tools

LetzAI Canvas 新增记忆功能:角色物体场景可命名保存

LetzAI 的 Canvas 新增记忆功能,可为角色、物体、场景命名并添加简短描述,保存为可复用的记忆。该功能面向 AI 视觉创作,旨在提升跨镜头、跨项目的元素一致性,官方已发布演示链接。

做角色 IP 和短剧的可以试试,把角色、物体、场景存成记忆,跨镜头一致性省不少事。

点击打开原平台查看,能否访问取决于网络环境

HeyGen 数字人自动生成房产带看视频

HeyGen 推出新功能:用户粘贴 Zillow 房产链接后,数字人分身会自动生成带看视频,用用户的声音进行讲解,替代传统文字回复。该功能面向房产经纪场景,将数字人分身与房产数据源打通,实现视频内容的自动化生成。

HeyGen 把数字人分身接进 Zillow 房产链接,粘贴链接就能自动生成带看视频,做房产营销和批量视频的团队可以看看这个自动化链路怎么跑。

点击打开原文,能否访问取决于网络环境

Kimi Work 教程:AI 自动构建幻灯片

Kimi Work 官方发布教程,展示其 AI 幻灯片生成能力:基于 Kimi K3 模型自动完成结构梳理与资料研究,生成包含图表和 SmartArt 的整套设计,成品可直接编辑下载。面向提案、汇报等办公场景,对 AI 影视从业者的项目路演和方案展示有间接帮助。

做 AI 短剧提案、项目路演的制片和编导可以试试,从大纲到成稿不用切工具,省掉排版时间。

点击打开原平台查看,能否访问取决于网络环境

美团 LongCat 新增 5000 万 token 低价包

美团 LongCat 官方宣布新增 5000 万 token 低价包,售价 $4.9(原价 $14.9,限时 67% 折扣),支持重复购买;另设 $1.9 新手入门包,新用户限购一次。面向长上下文处理场景,适合批量生成或长文本任务。

做 AI 短剧或批量出片的团队,如果已经在用 LongCat 跑长上下文,这个 $4.9 的 5000 万 token 包比原价便宜 67%,适合囤量跑大批量任务。

点击打开原文,能否访问取决于网络环境

方法与经验

Methods

Seedance 2.5 官方手册:七类场景提示词公式可抄

Seedance 2.5 官方用户手册,覆盖上传素材参数上限、界面四个新入口、七类场景提示词公式及 16 个亮点功能官方演示,公式和案例提示词可直接套用,面向用即梦做视频的创作者。

即梦用户直接收藏当工作台手册,七类场景提示词公式和 16 个功能演示都能照着抄,跑一遍就知道出片稳不稳。

点击打开原文,能否访问取决于网络环境

MiniMax H3 本地实测:5090 生成 5 秒视频约 350 秒

MiniMax H3 已发布并支持本地运行,作者在 ComfyUI 中实测:用 RTX 5090 在 1376x768 分辨率生成 5 秒视频耗时约 350 秒,视频质量感觉不错,且无需付费。

MiniMax H3 开源可本地跑,实测 5090 上 1376x768 出 5 秒视频约 350 秒,质量不错。做短剧和视觉的可以拉下来在 ComfyUI 里跑一遍,看本地出片速度和废片率。

点击打开原平台查看,能否访问取决于网络环境

本地部署 MiniMax H3:15 秒视频跑 20 分钟

用户 @servasyy_ai 分享本地搭建 MiniMax H3(海螺3)的完整配置:H3 Ref2VA 原生音画链,主模型 20.97GB、Qwen3-VL-32B 编码器 15.69GB、Video VAE 5.21GB、Audio VAE 0.61GB,权重合计 42.47GB。在 ComfyUI 0.30.0 + 原生 MiniMaxH3ReferenceToVideo 节点、PyTorch 2.11、CUDA 12.8 环境下,15 秒视频(3 张参考图、1152×640、24fps、362 帧、20 步)耗时 20 多分钟。

H3 本地部署的完整参数清单,权重合计 42.47GB,ComfyUI 0.30.0 原生节点跑通。做本地工作流的技术整合者可以直接抄配置,视觉师可参考 3 张参考图 + 1152×640 的出图规格。

点击打开原平台查看,能否访问取决于网络环境

MiniMax H3 量化版本地跑通:消费级显卡 3 分钟出片

个人创作者实测 MiniMax H3 INT8 量化版本地部署:RTX5070Ti+32GB 内存在 ComfyUI 中 170 秒生成一段科幻片段,作者称 RTX3060 即可运行,全程本地、约 3 分钟、耗电不到一度。工作流为:写剧情→用 ChatGPT 5.6 将镜头情绪描述转为专业术语→粘贴提示词→运行。作者认为该质量与价格足以让 Seedance 失去部分市场份额。

个人实测:MiniMax H3 INT8 量化版在 RTX5070Ti 上 170 秒出片,作者称 3060 也能跑。做短剧和科幻题材的可以照着这套 ComfyUI 工作流跑一遍,省掉 Seedance API 费用。

点击打开原平台查看,能否访问取决于网络环境

Luma 教程:AI 改图中文字保留原设计

Luma AI 官方博客发布图文教程,讲解如何用 AI 编辑图片中的文字内容,在替换文案的同时保留原有版式与设计风格。教程面向视觉设计场景,核心是解决改字不改版的需求,适合海报、KV、电商主图等需要频繁调整文案的创作流程。

做海报、KV、电商图的视觉师可以直接抄作业,改文案不用重画,套这个流程能省一半返工时间。

点击打开原文

宝玉分享 Fable 5 写方案 Codex 执行验收工作流

宝玉分享多 Agent 协作工作流:Fable 5 产出技术方案文档(方便批注和让其他 Agent 上手),确认后立即 /compact 一次以利用 Prompt Caching 低成本压缩上下文;将文档交给 Codex(GPT-5.6 Sol xhigh)执行,复杂任务加 /goal 避免反复 continue;完成后让 Fable 5 验证有无遗漏或方向偏离,反馈发回同一 Codex 会话继续完善。也可用 Opus 5 替代 GPT-5.6,但实测 Opus 5 不如 GPT-5.6 Sol 稳定和耐用。

个人实战工作流分享:Fable 5 出方案文档、Codex 执行、Fable 5 验收,还讲了 /compact 卡 Prompt Caching 省成本的细节。做 AI 自动化链路整合的可以抄这套多 Agent 协作模式。

点击打开原文,能否访问取决于网络环境

HeyGen 团队休陪产假,LiveAvatar 代理接管收件箱 8 周

HeyGen 官方发布客户案例:团队成员休陪产假期间,其 LiveAvatar 销售代理接管收件箱 8 周,完成 2741 次对话、带来 132 个新客户、创造 300 万美金销售管道,全程零人工干预。展示了数字人代理在真实商业场景中的自动化销售能力。

HeyGen 官方客户案例:LiveAvatar 销售代理 8 周自动处理 2741 次对话、带来 132 个新客户和 300 万美金管道。做 AI 短剧和数字人应用的可以看看这套自动化销售链路怎么跑通的。

点击打开原文,能否访问取决于网络环境

博主拆解国风国学 AI 视频赛道变现套路

博主微尘印记分享国风/国学 AI 视频赛道观察,指出该赛道粉丝稳定、带货佣金普遍 50% 以上,建议用 AI 提炼同类账号的套路。

做 AI 短剧和 IP 运营的可以看看国风国学赛道的变现逻辑,粉丝稳定、带货佣金高,适合当选题和商业参考。

点击打开原文,能否访问取决于网络环境

给中小企业搭AI知识库,一单八千到三万

博主分享给中小企业搭内部 AI 知识库的接单生意:用 Dify 或 FastGPT 搭 RAG 知识库,接 DeepSeek API,挂到企业微信或飞书机器人。基础版报价八千到一万五,含流程梳理和权限分级的三万起,后续维护收年费。最耗时的是清洗散落在微信群、飞书文档和 PDF 里的资料,涉及财务人事的库要单独做权限。

AI 搞钱副业思路,用 Dify/FastGPT 搭 RAG 知识库接 DeepSeek,挂企业微信机器人。做 AI 短剧或内容团队的可以当个接单副业参考,跟创作工作流关系不大。

个人开发者分享自建 AI 创作管理系统经验

个人开发者卫斯理分享从 7 月 20 日开始用 vibe coding 自建系统的经验,从个人主页、商品售卖网站到课程网站,最终搭建了一个集收益分析(每日凌晨抓取各渠道收益并用 Deepseek 分析)、网站监控、工具网站(markdown 转 png、图床、图文生成、AI 改写、微信排版)和创作(短文/长文创作 + AI 改写)于一体的管理中心。强调自建工具贴合个人需求,工作流程化后效率提升。

个人开发者分享用 vibe coding 自建收益分析、网站监控、图文生成、AI 改写等一体化管理中心的经验,强调自建工具贴合个人需求。对想搭建个人创作工作流的技术整合者有参考价值,但偏个人经验分享。

作品与案例

Works

Seedance 2.5 演示:维多利亚马戏团一镜到底

BytePlus 官方发布 Seedance 2.5 演示短片《ON CUE》,以维多利亚马戏团为题材,展示魔术师登台、表演者入场到精心编排的混乱场面,核心卖点是原生视频生成支持最长 30 秒,验证长镜头叙事能力。

官方演示片,重点看 30 秒原生视频生成下的长镜头调度和群像场面控制,做短剧和视觉的可以拉片看镜头连贯性处理。

点击打开原平台查看,能否访问取决于网络环境

MiniMax H3 实测:九场戏锁定同一角色脸

Magnific 团队用 MiniMax H3 制作短片《One Odysseus in nine scenes》,核心卖点是锁定单一角色、九个场景保持同一张脸。推文附工作流拆解链接,展示跨场景角色一致性控制方法。

用 MiniMax H3 锁定单一角色拍了九场戏,主打跨场景脸不崩。做短剧和角色 IP 的可以拉片看角色一致性怎么控,视觉师重点看同一张脸在不同镜头里的稳定度。

点击打开原平台查看,能否访问取决于网络环境

Flux 3 发布:自指式纪录片生成

fofrAI 用 Flux 3 生成一部 90 年代风格纪录片,内容是关于这部纪录片本身的纪录片,片中包含来自自身的片段,实现叙事上的自指套娃结构。

自指式纪录片结构,AI 短片玩叙事套娃的可以拉片看怎么用镜头语言实现自我引用。

点击打开原平台查看,能否访问取决于网络环境

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索