AI资讯归档 - 智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台 https://www.qske.com/news/ 智融AI产业综合平台——汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI!提供AI软件、AI硬件、AI软硬件厂商、AI活动、AI资讯一站式服务。 Sat, 25 Jul 2026 02:56:00 +0000 zh-Hans hourly 1 https://wordpress.org/?v=7.0.2 https://www.qske.com/wp-content/uploads/2026/05/智融AI产业综合平台logo四方-120x120.png AI资讯归档 - 智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台 https://www.qske.com/news/ 32 32 快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互模型 https://www.qske.com/news/%e5%bf%ab%e4%b8%80%e7%82%b9%ef%bc%81%e5%86%8d%e5%bf%ab%e4%b8%80%e7%82%b9%ef%bc%81%e5%bf%ab%e5%88%b0%e4%b8%96%e7%95%8c%e8%83%bd%e5%ae%9e%e6%97%b6%e7%94%9f%e6%88%90%ef%bd%9c%e5%92%8c%e7%94%9f%e6%95%b0/ https://www.qske.com/news/%e5%bf%ab%e4%b8%80%e7%82%b9%ef%bc%81%e5%86%8d%e5%bf%ab%e4%b8%80%e7%82%b9%ef%bc%81%e5%bf%ab%e5%88%b0%e4%b8%96%e7%95%8c%e8%83%bd%e5%ae%9e%e6%97%b6%e7%94%9f%e6%88%90%ef%bd%9c%e5%92%8c%e7%94%9f%e6%95%b0/#respond Sat, 25 Jul 2026 02:56:00 +0000 https://www.qske.com/news/%e5%bf%ab%e4%b8%80%e7%82%b9%ef%bc%81%e5%86%8d%e5%bf%ab%e4%b8%80%e7%82%b9%ef%bc%81%e5%bf%ab%e5%88%b0%e4%b8%96%e7%95%8c%e8%83%bd%e5%ae%9e%e6%97%b6%e7%94%9f%e6%88%90%ef%bd%9c%e5%92%8c%e7%94%9f%e6%95%b0/ 金涛今年 26 岁,还是清华在读博士。真正把他带进「推理加速」的,是一个很朴素的判断——当大家都默认 FlashAttention 已经把 Attention 算子做到极致时,他却发现:显卡上明明还有更快的计算单元没被用起来 ——「这么明显的收益,为什么没人做?」

快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互模型最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互视频

🚥 没人喜欢等待。

模型越强,推理加速就越重要。这一期,我们聊「推理加速」。

本周「十字路口」的嘉宾是生数科技的张金涛。月初,他带队发布了 Vidu S1——一个实时交互视频模型:上传一张照片,无论是人物、动漫角色,还是一只宠物,都能变成一个可以和你实时视频通话的 AI 角色。

Vidu S1 很快,快到生成速度超过播放速度,并且支持无限时长。这是怎么做到的?

金涛在播客中分享了自己这几年一条清晰的技术主线:从 SageAttention(GitHub 3.5K 星标)、TurboDiffusion(GitHub 3.6K 星标),到 TurboServe——一整套系统级方案,为 S1 实时交互提供底层支撑。

此外,金涛也分享了他对整个 AI「推理加速」领域的观察和判断。

其实这期有意思的,不只是技术。

金涛今年 26 岁,还是清华在读博士。真正把他带进「推理加速」的,是一个很朴素的判断——当大家都默认 FlashAttention 已经把 Attention 算子做到极致时,他却发现:显卡上明明还有更快的计算单元没被用起来 ——「这么明显的收益,为什么没人做?」

所以这期节目,你也可以把它当成一份「年轻研究者样本」来听:在变化极快的 AI 领域,怎么找到自己的方向、怎么判断什么才是「最正确的事」,又怎么把它一路做到最前沿。

快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互视频

快问快答

👦🏻 Koji

你的年龄?

👨🏻‍💻 张金涛

26 岁。

👦🏻 Koji

毕业院校?

👨🏻‍💻 张金涛

清华大学博士在读。

👦🏻 Koji

MBTI 和星座?

👨🏻‍💻 张金涛

INTJ,水瓶座。

👦🏻 Koji

一句话介绍 Vidu S1 到底是什么?

👨🏻‍💻 张金涛

它是一个实时交互的视频生成模型,可以通过语音实时控制生成的视频内容。

👦🏻 Koji

在生数科技,除了 S1 项目,你还负责哪些工作?

👨🏻‍💻 张金涛

我负责生数所有模型的推理加速和集群部署。其实我主导的是整个流式视频生成模型的全链路工程,从数据、训练算法,到推理工程化,再到模型的最终评测。

硬件上明明有更快的计算单元

“为什么没有人做?这是很明显的一个收益。”

👦🏻 Koji

加入生数之前,你主要在做什么?

👨🏻‍💻 张金涛

我主要跟着朱军老师读博,做推理加速方向的学术研究。在正式加入生数之前,我还去 UC Berkeley 访问学习了半年。

👦🏻 Koji

你是什么契机开始做推理加速的?很多业内人士知道你,是因为你最早的一个代表作 SageAttention。

👨🏻‍💻 张金涛

硕士二年级时,我选择硕转博,师从朱军老师。朱老师看我之前做过一些系统级的工作,就安排陈键飞老师带我。陈老师非常直接地告诉我:推理加速是未来至关重要的方向。

快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互视频

他安排我去做 Attention 的底层加速。SageAttention 就是我当时做出的第一个成果。它是一个即插即用的、更快的 Attention 算子实现,能直接用来替换大模型中的 Attention 计算。

👦🏻 Koji

即插即用?

👨🏻‍💻 张金涛

对。当时我和陈键飞老师发现,虽然 FlashAttention 影响力巨大,行业也基本认为它已经把 Attention 算子做到了极致。但在硬件底层,明明还有更快的计算单元未被发掘。

大模型的核心运算主要有两类:线性层计算和 Attention 计算。

那些更快的硬件计算单元在线性层加速中早已被广泛应用。但当时 FlashAttention 出来后,竟然没有任何一个工作能调用 GPU 上那些更快的计算单元去加速 Attention。

我们当时很困惑:为什么没人做?这背后的性能收益是非常明显的。既然没人做,我们就决定把它做出来。

👦🏻 Koji

所以当时为什么没人做?

👨🏻‍💻 张金涛

因为做低比特加速的 Attention 计算,挑战非常大。

第一,传统的语言模型在 Attention 计算上往往是 Memory Bound。在这种情况下,单纯加速 Attention 的计算单元并不会带来太大的端到端收益,因此大家缺乏去做的 Motivation。

但后来多模态模型和视频生成模型兴起。我们发现,它们的 Attention 范式属于严重的 Compute Bound。计算速度直接决定了 Attention 的耗时,计算加速的收益变得非常高。但在 2024 年初之前,行业还没意识到这一点。

第二, Attention 的低比特加速本身存在极高的工程门槛。它不像普通的线性层,用 PyTorch 写几行代码、调个量化 API 就能解决。

Attention 的计算特性逼着你必须深入到底层,手写 GPU 的 Kernel 代码。在 2024 年初之前,大家在手写 CUDA 或底层 GPU 编程上的门槛还是蛮高的。

👦🏻 Koji

需要手写?

👨🏻‍💻 张金涛

对,基本上手写。

第三, Attention 计算的精度对低比特量化的精度极其敏感。如果直接把 Attention 的所有计算量化到 8 比特,用到语言模型或视频生成模型里,输出的内容质量会一塌糊涂。

而我们攻克了后面的两项工程和算法挑战,才成功把 SageAttention 做了出来。

从 SageAttention 到 Vidu S1:三层加速

👦🏻 Koji

从当时的 SageAttention 到现在发布 Vidu S1,其背后核心也是因为推理加速技术走到了这一步,才支撑起流式生成的流畅度。从 SageAttention 到 S1,中间经历了哪几个关键的里程碑?

👨🏻‍💻 张金涛

Vidu S1 已经向全球开放了体验网站和 API 平台。

我想强调的第一点是, Vidu S1 并不是一个单点的算子加速,它是“模型 + 集群部署”的全栈优化。推理加速在其中只占一部分。

如果把这个演进拆开,它确实经历了三个阶段:

第一阶段是算子层的加速。研究如何让线性层、非线性层以及 Attention 算子在特定硬件上跑得更快,尽可能榨干 GPU 的极限。

第二阶段是模型层面的复杂度优化。不单要让算子跑得快,还要让模型的计算量变小。我们通过“步数蒸馏”,把 Diffusion 模型的去噪步数从 50 步压缩到了 4 步,计算复杂度直接下降十几倍。同时引入稀疏 Attention,在降低计算复杂度的同时维持模型效果。

第三阶段是工程化的集群部署。当单个模型在单卡或多卡上跑通后,如何把它部署到庞大的服务器集群上,支撑全球海量用户实时发起请求?这涉及到多卡并行、模型并行以及请求调度。在这方面我们做了极其繁重的工程优化,核心是如何做并发和调度。

👦🏻 Koji

在 SageAttention 之后,你们还做过一个开源项目 TurboDiffusion。能聊聊它在其中扮演了什么角色吗?

👨🏻‍💻 张金涛

TurboDiffusion 恰好对应了我刚才提到的第二阶段:当我们手握极快的 SageAttention 算子后,如何让任意一个 Diffusion 模型在单卡或单机上跑得飞起?

在这个模型层面上,我们不仅塞入了更快的线性层和 Attention 算子,还做了一套通用的模型蒸馏和稀疏 Attention 算法。

这些算法和算子优化不同,它是需要通过模型训练和微调去实现的。比如通过微调稀疏 Attention 或蒸馏训练,在降低模型复杂度的同时确保画面质量。

另外在工程层面,当多卡并行时,如何把卡间的通信耗时与单卡上的计算耗时完美地 overlap 起来。

总体来说, TurboDiffusion 是一次模型架构和微调层面的优化,同时叠加了部分的工程优化。

👦🏻 Koji

在学校做这些研究时,数据和算力资源应该很有限吧?

👨🏻‍💻 张金涛

对。做 TurboDiffusion 时,我们手头的计算资源确实相对受限。不过 TurboDiffusion 本身不需要太庞大的训练资源。

我们基于开源的视频生成模型,用了很少量的微调数据就把它跑通了。

👦🏻 Koji

目前它在 GitHub 上拿到了多少 Star?

👨🏻‍💻 张金涛

3600 多个 Star。

👦🏻 Koji

在这个领域,这算是一个什么样的成绩?

👨🏻‍💻 张金涛

算是一个还不错的表现。

👦🏻 Koji

在行业里,有哪些公司或模型采纳了 SageAttention 或 TurboDiffusion 吗?

👨🏻‍💻 张金涛

SageAttention 让我比较自豪的是,它已经成为了行业事实上的标准。

不仅 NVIDIA、 AMD 官方在用,国内的华为昇腾、摩尔线程、沐曦等硬件厂商也都在显卡底层实现了自己的 SageAttention 部署。在算法公司方面,几乎所有的多模态大厂,像字节、腾讯、生数,甚至 Google 都在使用。

Vidu S1 不只是快

“生成速度需要大于播放速度,它才能做到实时生成。”

👦🏻 Koji

回到 Vidu S1,大家看到流式视频生成的第一反应都是“快”。

这种“快”的背后,到底沉淀了怎样的技术突破?

👨🏻‍💻 张金涛

其实我们不能单纯用“快”来概括流式视频模型。

传统的视频生成模型是“离线”的:输入一段 Prompt,包装好发送出去,耐心等上一阵子,它会吐出一段 5 秒或 10 秒的视频。

但流式、实时视频生成的交互范式是完全不同的。它是你在“实时”地和它对话,每一帧都是根据你的输入当场计算、当场渲染出来的。它的生成速度必须大于播放速度,用户才不会觉得卡顿。

所以它不是一个简单的“提速问题”,它重塑了整个生成的链路。

👦🏻 Koji

那这之中最大的挑战是什么?

👨🏻‍💻 张金涛

最大的挑战是:如何在确保高画质的前提下,实现超长甚至无限时长的流畅生成。

目前的离线视频生成模型,最长一次性也就生成 30 秒左右。但实时交互不可能只聊 30 秒,我们往往需要它持续生成几十分钟甚至数小时,且画面不能发生漂移或崩溃。这对模型的稳定性提出了极苛刻的要求。

👦🏻 Koji

听说 Vidu S1 可以跟用户聊上几天几夜,你们是怎么解决画面不漂移、不崩溃的?

👨🏻‍💻 张金涛

这依赖于我们在 Diffusion 训练上做的一些非常底层的探索。

特别是在 Attention 的计算架构设计,以及噪声强度的控制上,我们摸索出了一套很先进的机制,成功解决了长视频生成中的画质衰减和内容漂移问题。

在推理优化上, Vidu S1 可以做到 540P 的分辨率,这在目前的实时生成模型里是极少见的。同时,它的帧率可以稳定在 25 到 42 FPS。

最关键的是,普通用户在消费级显卡上就能直接跑出这个效果。

👦🏻 Koji

要在速度、画质以及长时一致性上同时做到极致,必然需要做一些取舍。在这个过程中, Vidu S1 牺牲了什么?

👨🏻‍💻 张金涛

trade off 肯定有。

因为我们把“实时交互”作为第一优先级,所以必须首先确保响应的实时性。在这个红线之上,我们再去尽最大可能优化画质和生成的一致性。

👦🏻 Koji

所以快是第一目标?

👨🏻‍💻 张金涛

对,“快”是绝对的前提。

👦🏻 Koji

在画质、成本和一致性的优先级排布里,目前哪一个是排在最后的?

👨🏻‍💻 张金涛

现阶段,如果非要排一个末位,我们只能选择让画质稍微做一点妥协。

👦🏻 Koji

目前体验平台已经对公众开放,它的商业化和收费模式是怎样的?

👨🏻‍💻 张金涛

我们面向大众开放的网页端和 App 端体验是完全免费的。对于 API 平台,我们采取按时计费,大约每分钟两三块钱,没有时长限制。

快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互视频

“未来我们的视觉娱乐信号,会被 AI 生成的内容充斥掉。”

👦🏻 Koji

流式、实时的在线交互视频,未来会成为一个巨大的趋势吗?

👨🏻‍💻 张金涛

视频模型本质上是为了满足人类的视觉娱乐需求。

这种需求可以分成两类:

一类是离线、预制好的视频,比如电影或短视频;

另一类是实时的、在线交互。

比如你我今天的对话,就是典型的实时在线交互。

👦🏻 Koji

我们的在线,是指能够接收对方的实时反馈?

👨🏻‍💻 张金涛

对。我说什么你当即就能知道,并根据我的状态做出相应的动作和言语回馈。

在恋爱、游戏,甚至几乎所有的日常社交场景里,这种“实时交互”才是人类最大、最本能的视觉娱乐需求。在数字革命之前,人类所有的视觉娱乐基本都是实时在线交互的。

离线预制视频有“播放量”的上限,但实时交互视频的奇妙之处在于:每个人都拥有独一无二的 Session,你看到的画面只属于你。

👦🏻 Koji

每个人都拥有一个独立的 Session。这也是 Elon Musk 那个计算模型的底层逻辑。

👨🏻‍💻 张金涛

是的。未来所有的视觉信号可能都会被 AI 实时生成的内容所填满。

从技术路径上来看,这没有任何瓶颈和不可能。这种实时交互式的视频生成,必然是未来最核心、需求量最大的赛道,大势所趋。

 一只狗和一个游戏搭子

👦🏻 Koji

发布到现在,有看到用户用 Vidu S1 玩出什么有意思的场景吗?

👨🏻‍💻 张金涛

虽然才发布了不到一天,但社区里的反馈已经非常疯狂。

因为在此之前,全球没有任何一个模型能让用户通过语音实时控制视频的生成,更无法做到无限时长的交互,同时还支持自定义角色。

我看到了很多爆款案例。比如有人上传了自己家小狗的照片,然后直接和 AI 化的小狗实时聊天,小狗会根据他说的话做出各种活灵活现的反应。

还有 Vidu S1 具备视频理解能力,支持输入视频信号。我在 B 站上看到一个玩家,把屏幕的 3/4 留给游戏画面,另外 1/4 上传了一个二次元女孩。

👦🏻 Koji

把游戏画面当做实时视频流喂给模型?

👨🏻‍💻 张金涛

对。他一边玩游戏,右边的二次元女孩一边实时看着他的游戏画面陪他聊天。女孩能看懂游戏里发生的一切,并当场做出反应。

👦🏻 Koji

那理论上,我每天写代码的 Coding 界面也能当做视频流传给它,让它扮演一个“程序员鼓励师”?

👨🏻‍💻 张金涛

当然可以。

👦🏻 Koji

它能看到我是在微信聊天,还是在 Notion 里写文档,并随时给我各种语音和动作反馈?

👨🏻‍💻 张金涛

完全可以。它能看懂你写的每一个字和画面,它具有极强的多模态视频理解能力。

未来两周,社区里一定会冒出极多好玩的玩法。还有个同学把博主“峰哥”的照片和转圈舞人设传了上去,让峰哥在屏幕里实时给他送生日祝福、跳转圈舞,体验非常魔性。

推理加速不只是算子

👦🏻 Koji

我们再回到推理加速。你做的大多是多模态模型的推理加速,但其实大语言模型的推理加速也极其重要。在过去一年,我们看到了许多芯片层面的创新,比如 Cerebras、 Taalas 等。

快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互视频

能为我们介绍一下,目前在推理加速领域,有哪些比较重要、值得关注的工作或方向吗?

👨🏻‍💻 张金涛

推理加速,字面意思就是让模型推理得更快。

如果不考虑芯片设计层面,我认为主要有两个维度的核心工作:

第一,在算子层。我们要让模型的计算在特定硬件上跑得非常快,尽可能逼近硬件的极致水平。但大家容易有一个误解,认为推理加速仅仅是做这件事。

👦🏻 Koji

就是让模型在特定硬件上计算到理论最大值?

👨🏻‍💻 张金涛

对,让某个算子计算得更快。这当然非常重要。

但推理加速另一个极其关键的地方,是如何把模型的计算复杂度降下来。

我们希望实现端到端推理的加速——输入一个请求,它能够迅速输出。

AI 模型本身像一个黑盒,在这个黑盒里实际上存在大量的冗余计算。我们能否把这些冗余省去?

比如通过稀疏 Attention,或者优化模型架构(如 MoE 架构),亦或是采用蒸馏技术(不管是模型大小的蒸馏,还是采样步数的蒸馏)。对于推理加速,我认为应该这样去定义。

当然,关于芯片设计我了解得并不是非常多。如果再拆开一层,像 NVIDIA 他们做的硬件迭代,提高硬件本身的计算速度,也可以算作广义的推理加速。

目前行业内比较好的推理加速工作,比如在 Diffusion 模型或多模态模型上,开源项目中的 vLLM 涉及到了我前面提到的几层优化,不过它更侧重于调度和管理层面的工作。

我们之前做的 SageAttention,以及后来结合工程优化的 SLA(Sparse Linear Attention),主要是针对算子本身以及模型复杂度降低的探索。

在 Diffusion 模型上,传统的离线生成相对简单,因为它只有一条用户请求,不需要做 Batching 和 KV Cache 调度。

但是最近,由于流式交互的需求增加, Diffusion 生成的过程变成了一个类似自回归(Auto Regressive)的过程,这就涉及到 KV Cache 和复杂的请求调度。比如有用户接入、退出、或是中途中断。

所以,我认为未来会出现很多关于 Diffusion 模型如何做集群部署和调度的研究。我们在生数做的一篇工作叫《TurboServe》,就是针对流式视频生成模型在集群上如何调度和部署的。

在语言模型领域, DeepSeek 提出的 DSA(DeepSeek Sparse Attention)是非常不错的。

👦🏻 Koji

大家基于开源 DFlash 框架所做的 UltraSpeed(如 DSpark、小米 Mimo ),效果都非常显著。

👨🏻‍💻 张金涛

在多模态和 Diffusion 领域,我们开源的 Sparse Linear Attention 用来做稀疏 Attention 加速,也得到了腾讯和字节跳动多模态负责人的认可,他们都在使用,认为这是一个非常好的工作。

当然,我们开源的这一版 SLA 在 Linear Attention 的选型上还存在一些微小的缺陷。我提到过的这些只是我接触并认可的工作,并不代表全部,行业内依然存在大量非常优秀的推理加速研究。

推理加速的未来,属于更底层和更上层

“推理加速的未来,还是属于更底层和更上层。”

👦🏻 Koji

关于推理加速的未来,你提到会属于两个极端:更底层和更上层。可以展开讲讲吗?

👨🏻‍💻 张金涛

好的。

首先,单个算子在硬件上如何物理收敛运行,这个方向未来会逐渐定型。大家都掌握了非常先进的代码编写方法,也更了解硬件架构,所以单纯算子优化在未来不会有太高壁垒。

我所谓的“更底层”,是指直接去造通用性极强且计算速度极快的硬件(就像 NVIDIA 所做的工作),或者针对特定的模型(比如实时交互视频生成模型)量身定制专用芯片。

👦🏻 Koji

就像 Taalas 一样,把一个特定的模型写死到芯片里?

👨🏻‍💻 张金涛

这是一种思路,但可能有些过于昂贵。一旦模型更新,芯片就废弃了。

我认为更可行的底层思路是,芯片保持定制化的同时,留有一定的通用性。

比如,语言模型的 Attention 计算通常是 Memory Bound(受限于显存传输速度,而非计算速度);而视频生成模型大多是 Compute Bound。通过动态调整计算与传输的比例、显存大小、各种精度的计算单元数量等,在通用和专用之间取得平衡。这需要非常强的芯片设计与算法协同能力。

而我所谓的“更上层”,则是在算法和模型层面进行优化,核心是如何大幅降低模型的计算复杂度。比如人类的大脑仅有 25 瓦的功耗,却可以解决极其复杂的任务。从理论上讲,我们完全有可能降低模型的计算复杂度。

这同样分为通用和专用:

通用的方向是降低模型在处理各项任务时的复杂度;

专用的方向是让模型针对不同的用户请求,可以用非常简化的计算去满足,而不需要让每一个 Token、每一次请求都走一遍完整的 Layer。

我认为这一上一下的两个方向,在未来会变得越来越重要。

👦🏻 Koji

在底层是不是更容易诞生创业公司?因为在顶层似乎很难独立支撑起一个商业帝国。

👨🏻‍💻 张金涛

一个真正优秀的推理加速产品,核心一定需要硬件和算法的 Co-Design。所以从创业公司的角度,其实这两方面的能力都需要兼备。

不过你说的也有道理,如果创业公司只专注于硬件底层,或者走 Co-Design 路线,都有可能成功。但如果仅仅局限于算法层,确实不容易形成壁垒,因为单纯的算法研究很难在最底层得到深度的硬件验证。

中国视频模型的领先原因

👦🏻 Koji

我们来聊聊整个 AI 视频行业。最近几个月,我发现中美两边正在发生分化。中国的视频模型表现越来越亮眼,已经稳稳站住了全球第一梯队。

在你看来,国内视频模型能形成这种优势的原因是什么?

👨🏻‍💻 张金涛

AI 的本质是对特定问题进行建模,建完模之后通过训练数据去学习,学的是输入数据与输出数据之间的映射关系。

自 Transformer 诞生以来,如今在建模架构上“雕花”,已经很难带来本质性的突破了。

所以,现在的核心竞争点在于数据。

快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互视频

这就跟人类的学习一样,一个人能否学好,第一取决于他的智商(相当于大脑建模),第二则取决于他接受的教育。好的讲解方式和糟糕的讲解方式,学习效果天差地别。

比如一个复杂的物理规律,遇到好的讲解, 10 分钟就能让人豁然开朗;像苏剑林在《科学空间》里整理的内容就非常通透,看 10 分钟甚至比看那些垃圾博客或受污染的数据 3 个小时收获还要多。

既然在建模上已经相对收敛,那么关键就在于,你能不能把数据清洗并构造成高品质、符合人类偏好、具备极强可学习性的内容。就像 Reasoning,如果让模型直接跨越问题 A 强行去学答案 Z,它会学不会。但如果把数据构造成思维链,循序渐进地学习,它就能掌握。

据我观察,美国的视频生成公司在数据量、数据质量、偏好对齐以及数据的构造方式上,目前做得确实不如国内的头部视频生成公司。

具体原因,每个人可能都有不同的思考,比如在数据获取的合规政策等方面存在一些客观差异。这是第一点。

第二点在于中美文化的差异以及市场环境的不同。我们国内对短视频、直播、电商(如抖音、小红书)的需求极大,这些行业发展更迅速。

因此,我们不仅能积累更丰富的视频数据,也拥有更强的动力去探索如何通过视频生成满足用户的视觉娱乐需求。

👦🏻 Koji

这很有意思。

👨🏻‍💻 张金涛

我觉得主要就是这两点。

👦🏻 Koji

感觉 2026 年有一个非常大的趋势,就是许多高校教授和 PhD 都在大量投身创业。早几年,像智谱 AI 的唐杰老师、生数科技的朱军老师,都是非常优秀的学者创业代表,但在当时还没有形成像今天这样的全民热潮。

作为身处其中的一员,你对此有什么切身感受?

👨🏻‍💻 张金涛

首先,我认为 AI 并非泡沫,它确实能够解决并满足人类极大的现实需求,无论是硬件还是模型层面的发展,大方向是极其笃定。

所以这波创业热潮非常合理,并且能够持续很长时间,并没有太多泡沫。

第二,因为需求体量太庞大,没有任何一家公司能够垄断所有场景。未来会有许多不同的创业公司脱颖而出。

不过我也发现,创业并不是适合每个人的。在生数科技这一段时间,坦诚、或者说有些不谦虚地讲,我觉得自己蛮适合做管理的。我能够凝聚起一个团队,能敏锐地察觉到每个人的诉求,知道把对的人放在对的位置上,并做好复杂的资源协调。

相比之下,有些技术水平极高的优秀人才,其实并不适合做管理。

如何让大家工作得既开心,又始终保持高昂的斗志去做世界上最领先的技术,这其实是一门很深的学问。

世界领先,是把每个环节都做对

“知道世界上最正确、最领先的方法是什么,然后把它正确实现出来。”

👦🏻 Koji

那你可以在这方面分享一下你的管理实践吗?比如,具体怎么让大家在开心中高标准地工作,如何激励大家勇于追求世界最领先的水平?

👨🏻‍💻 张金涛

这方面我受朱军老师的影响极深。

当初 OpenAI 刚发布 GPT-3 时,朱老师就告诉我们:不要觉得 GPT-3 遥不可及。它并不是在模型架构、数据或者训练方法上做出了多么颠覆的创新,它只是找准了最正确、最科学的方法,并在每一个环节上都做到了极致。

看清最正确的方向,然后用绝对正确的执行力在每一个细节上死磕,这就是世界领先的秘诀。我把这个逻辑贯彻到了我们推理组的每一行代码中。

很多项目没做好,不是因为不知道前沿方向,可能只是因为他们的代码库里藏着几行没有排查出来的 Bug。

至于如何让大家开心,我认为核心在于“敏感度”。

快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互视频

Leader 必须能敏锐地读懂每个人。有的人需要更好的薪酬,有的人在乎 Credit,而有的人纯粹追求技术突破的爽感。你必须精准满足他们的核心动力。

同时,你要帮团队树立威信。在跨部门协调资源和利益冲突时, Leader 必须展现出强大的决断力和基于本质思考的沟通方式。这也是许多单纯做学术的技术大牛容易缺失的特质。

 一行代码,速度快一倍

“视频生成得跟之前像素级一模一样,但端到端推理速度快了一倍多。”

👦🏻 Koji

能聊聊你个人的成长经历吗?你一路上是如何磨炼出这种综合特质的?

👨🏻‍💻 张金涛

我小时候挺贪玩,严重偏科,数学极好但语文很差。但现在我越来越觉得,沟通、表达和对他人情绪的敏感度至关重要,这些软实力其实和“语文”高度相关。

到了大学,我的自学和表达能力开始显现。当时竞争不算太激烈,我稍微花点心思就能拿到很好的绩点,也借此兼顾了科研。

在实验室里做 Paper 汇报时,我发现自己能极快地拆解出论文最核心的本质。我很享受把 PPT 的逻辑、文字和配图雕琢得非常 Sharp 的过程,让听众能瞬间抓住最核心的本质。

我认为写作是反映一个人思维深度的最好工具。

👦🏻 Koji

智能的边界有时就是语言的边界。能把复杂的问题讲得通俗、简单,恰恰证明你把它彻底想明白了?

👨🏻‍💻 张金涛

确实。把事情讲清楚不难,难的是把一个极其复杂的系统讲得极度简单。

我很享受这种“提炼”的过程:在写论文时,我会花非常多的精力去凝练我的 Motivation,把 Limitation、 Challenge 以及你的 Core Contribution 像雕刻一样凝练出来。每一句话、每一个词都要有强逻辑支撑。

硕转博之后,我迎来了科研和创业生涯中最快乐的一段时光。

做 SageAttention 时,我常常一个人待在清华的自强科技楼里。那会儿楼里很静,我沉浸在代码里,跟陈键飞老师讨论、跟朱老师汇报。一个线程一个线程地模拟,去排查微小的精度 Bug。当底层的 C++ 和 CUDA 代码一行行成型时,那种充实感无法言喻。

24 年 5 月,生数成立了 Vidu 推理组,负责全球上线的推理保障,朱老师直接把这担子交给了我。

我是直接在 Vidu 模型的生产环境里手写的 SageAttention。这是全球首个在实际业务里跑通的低比特 Attention 加速工作。

当代码替换掉原本的 FlashAttention,最终精度对上的那一刻,我发现视频生成的质量像素级一致,但端到端的推理速度直接翻了一倍。

那一刻我兴奋到了极点,迫不及待地把视频发给陈老师和朱老师看。后来我们把论文开源,发布了 Sparse Linear Attention 这篇工作,并在《TurboServe》里探索了集群调度。这种能帮业界解决实际痛点、带来开创性突破的快乐,是任何事情都无法替代的。

第二段开心的事是,我现在也在带领一个团队。朱老师非常信任我,把这一摊子事情交给我来负责,这也让我提前体验了创业的状态。

刚加入实验室时,我就发现朱军老师在学术、产业上的段位和眼界都极高。

具体体现在几个方面:

第一是认知极度前瞻,对前沿方向的研判和直觉非常敏锐。他的许多学生,比如翁家翌、陆承、庞天宇、宋飏等,都是行业里极度优秀的人才。

第二是朱老师能够为实验室争取并提供极其充足的计算与开发资源。

第三是实验室的学术氛围。我在 UC Berkeley 访问过半年,朱老师因为有 CMU 任教的背景和海外经历,把我们实验室的氛围建设得和伯克利十分像。我非常认可,也极其感谢朱老师的信任和培养。

👦🏻 Koji

听到你描述那种纯粹的技术突破和创造力带来的快乐,真的很让人振奋。

希望你在接下来的研发和创业旅程中,能收获更多这样美妙的时刻。非常感谢你今天的分享,期待未来有机会再来做客。

👨🏻‍💻 张金涛

谢谢 Koji,我也很开心能有这个机会和大家深度交流。

👦🏻 Koji

好的,拜拜。

👨🏻‍💻 张金涛

拜拜。

文章来自于微信公众号 “十字路口Crossing”,作者 “十字路口Crossing”

快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互模型最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
https://www.qske.com/news/%e5%bf%ab%e4%b8%80%e7%82%b9%ef%bc%81%e5%86%8d%e5%bf%ab%e4%b8%80%e7%82%b9%ef%bc%81%e5%bf%ab%e5%88%b0%e4%b8%96%e7%95%8c%e8%83%bd%e5%ae%9e%e6%97%b6%e7%94%9f%e6%88%90%ef%bd%9c%e5%92%8c%e7%94%9f%e6%95%b0/feed/ 0
刚刚,黄仁勋首次发推:半个硅谷,力挺Kimi K3开源 https://www.qske.com/news/%e5%88%9a%e5%88%9a%ef%bc%8c%e9%bb%84%e4%bb%81%e5%8b%8b%e9%a6%96%e6%ac%a1%e5%8f%91%e6%8e%a8%ef%bc%9a%e5%8d%8a%e4%b8%aa%e7%a1%85%e8%b0%b7%ef%bc%8c%e5%8a%9b%e6%8c%bakimi-k3%e5%bc%80%e6%ba%90/ https://www.qske.com/news/%e5%88%9a%e5%88%9a%ef%bc%8c%e9%bb%84%e4%bb%81%e5%8b%8b%e9%a6%96%e6%ac%a1%e5%8f%91%e6%8e%a8%ef%bc%9a%e5%8d%8a%e4%b8%aa%e7%a1%85%e8%b0%b7%ef%bc%8c%e5%8a%9b%e6%8c%bakimi-k3%e5%bc%80%e6%ba%90/#respond Fri, 24 Jul 2026 16:09:00 +0000 https://www.qske.com/news/%e5%88%9a%e5%88%9a%ef%bc%8c%e9%bb%84%e4%bb%81%e5%8b%8b%e9%a6%96%e6%ac%a1%e5%8f%91%e6%8e%a8%ef%bc%9a%e5%8d%8a%e4%b8%aa%e7%a1%85%e8%b0%b7%ef%bc%8c%e5%8a%9b%e6%8c%bakimi-k3%e5%bc%80%e6%ba%90/ 刚刚,英伟达创始人黄仁勋发出了自己人生第一条推特:在老黄的第一篇帖子中,他分享了一封英伟达签署的信函《开放权重与美国 AI 领导力》,阐述为什么开源模型很重要。他表示,人工智能将改变每个行业,赋能每个公司,并由每个国家构建。开源模型加强安全性和网络安全,加速创新和传播,并实现主权。

刚刚,黄仁勋首次发推:半个硅谷,力挺Kimi K3开源最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
活久见了。

刚刚,英伟达创始人黄仁勋发出了自己人生第一条推特:

刚刚,黄仁勋首次发推:半个硅谷,力挺Kimi K3开源

号是新注册的,推文是有点着急的。

在老黄的第一篇帖子中,他分享了一封英伟达签署的信函《开放权重与美国 AI 领导力》,阐述为什么开源模型很重要。

他表示,人工智能将改变每个行业,赋能每个公司,并由每个国家构建。开源模型加强安全性和网络安全,加速创新和传播,并实现主权。世界需要前沿闭源模型,也需要前沿开源模型。

其实这是一封有着 20 多家科技巨头、创业公司和投资机构联名签署的公开信,里面既有英伟达、微软、Meta,也有 Hugging Face、Mistral、YC。

刚刚,黄仁勋首次发推:半个硅谷,力挺Kimi K3开源

他们现在看起来打算携起手来「对抗」闭源巨头 OpenAI 与 Anthropic 了。

以下是全文翻译:

20 世纪 80 年代,开源软件的早期先驱们挑战了当时盛行的观念,即软件只有企业严格控制代码才能进步。这场运动推动建立一个透明的生态系统,让世界各地的开发者都能学习、修改和改进软件。如今,开源社区开发的软件支撑着互联网的大部分功能,并为全球最大的科技公司、美国军方和联邦机构开展科学研究、网络安全和其他关键任务的系统提供底层支持。开源的意义远不止降低软件成本;它还创建了一个共享的知识基础,一代又一代的美国工程师和企业家正是在此基础上建立了他们的机构自主权。

如今,美国在人工智能领域也面临着类似的抉择。评判我们 AI 领域的领导地位,并非取决于某一种前沿模型,而是取决于美国能否构建一个强大、开放的生态系统,并将其渗透到各个领域。这对于在全国范围内创造创新和繁荣的机遇至关重要。这需要扩大 AI 普及范围,鼓励竞争,构建强大的应用层,并赋予美国民众对其所依赖的技术更大的控制权。开放权重模型 —— 任何人都可以下载、检查、修改并在自己的基础设施上运行的 AI 模型 —— 是这一基础的重要组成部分,因为它们使先进的 AI 更易于获取、更灵活、更广泛地应用。

开放权重扩大了 AI 经济的准入范围。初创企业、成熟企业、大学和公共机构无需从零开始训练模型,也无需为每个任务支付前沿模型的高昂费用,即可利用先进模型进行构建。开放权重使每个组织都能以合适的成本为合适的任务匹配合适的模型,将前沿规模的能力保留给真正的前沿问题,并在其他所有领域运行高效的专业模型。这种自律性将使 AI 在经济上可持续发展,尤其是在其应用扩展到数十亿日常任务时。美国要想赢得人工智能时代,就必须将其普及到工厂、医院、农场、教室和街头商铺的工作流程中。

留给真正的前沿问题,并在其他所有领域运行高效的专业模型。这种自律性将使 AI 在经济上可持续发展,尤其是在其应用扩展到数十亿日常任务时。美国要想赢得人工智能时代,就必须将其普及到工厂、医院、农场、教室和街头商铺的工作流程中。

开放权重还能增强竞争,而竞争正是确保 AI 成果广泛共享而非集中在少数人手中的关键。通过允许众多组织构建、调整和部署高级模型,开放权重不仅在模型开发者之间,而且在云芯片、应用程序和服务之间都形成了竞争。这种竞争能够刺激创新、降低成本,并将 AI 的益处广泛惠及整个经济。

开放权重还能赋予客户更大的控制权。随着各组织投资 AI,他们希望确保不会被单一供应商束缚,也不会丢失随着时间积累的知识和能力。开放权重模型有助于提供这种保障,它允许组织掌控自身数据,评估模型并根据自身需求进行调整,并根据业务需要将其部署到任何需要的地方。此外,随着组织利用 AI 创造价值,开放权重还能让他们通过自我改进的模型、专业能力和积累的知识来拥有这些价值,从而推动美国的主权和繁荣。

诚然,开放权重确实存在一些独特的风险。一旦发布,这些权重就脱离了原始开发者的控制,修改后的版本也难以追踪或逆向操作。但应对这种风险的正确方法并非禁止开放权重。在网络安全攻击者利用先进 AI 技术的时代,防御者需要访问具有类似能力的模型,以便检测、模拟和应对新出现的威胁。开放模型能够扩展防御能力,提高透明度,并使多个团队能够发现和修复漏洞。

事实上,开放性可能是实现人工智能安全的最重要途径之一。仅仅依赖封闭模型并非绝对安全:它们可能被攻破、滥用,或者出现外部人员无法察觉的故障。将先进的 AI 能力集中在少数封闭模型之后会加剧这种风险。这会导致少数单点故障,削弱竞争,并将关键技术掌握在少数供应商手中。另一方面,开放权重模型允许广泛的研究人员和开发人员群体来检验其行为,识别漏洞,开发安全措施,并随着时间的推移不断改进。正如开源软件证明透明比隐蔽更安全一样,AI 安全可能取决于让更多人能够测试和加强社会赖以生存的模型。它允许进行严格的基准测试和评估、红队演练,以及与实际存在的危害相关的保护措施,而不是想当然地认为封闭系统默认更安全。

强大的 AI 生态系统并非理所当然。政策制定者拥有重要的行动契机。这包括扩大初创企业和研究人员的计算资源获取渠道,投资共享训练资源(数据集、工具、评估框架),并通过避免过早限制开放模型(这些限制会扼杀竞争或将创新导向海外)来保持前沿领域的多元化。这些措施还必须着眼于如何通过强大的应用层来扩大 AI 在整个经济领域的自主应用。

在构建这一生态系统时,政策制定者应谨慎区分合法的模型开发技术与盗用行为。模型提炼,即利用一个模型的输出结果来帮助训练或改进另一个模型,是一种广泛用于模型改进、评估和验证的技术。它体现了长期以来从现有技术中学习、发展和改进的传统,而这一传统自开源软件运动兴起以来就一直推动着创新。相比之下,非法从封闭模型中榨取价值的行为则引发了合理的担忧。这些担忧应通过有针对性的法律和商业框架来解决,而不是对在 AI 创新中发挥重要作用的技术进行全面限制。 

人工智能时代可以是一个繁荣的时代。只要做出正确的选择,开放的 AI 就能拓展机遇、增强竞争、巩固美国的科技领先地位、降低风险,并确保这项非凡技术的益处惠及我们经济的各个层面。这样的未来值得我们去构建,而美国应该引领这一进程。

震撼海外的 Kimi K3

这一切的导火索,显然源于 7 月 16 日发布并开源的最新大模型 Kimi K3。上个星期,Kimi K3 的发布堪称科技圈的「核弹级」事件。它不仅是目前开源社区能接触到的最大规模模型(总参数量 2.8 T),更在底层架构上做出了突破性的创新,实现了接近于 Fable 5 的编程能力。

目前,Kimi K3 的编码套餐和网页端都出现了售罄、限流情况,可见国内外技术社区对于新模型的狂热程度。月之暗面表示,K3 将在 7 月 27 日之前开放出完整模型权重。Hugging Face 现在甚至为 Kimi 新模型设置了一个倒计时的页面:

刚刚,黄仁勋首次发推:半个硅谷,力挺Kimi K3开源

全世界都在等待着。海外各大技术社区已开始流传针对 K3 的《部署备战指南》。

然而,Kimi K3 推出后,OpenAI 与 Anthropic 感到威胁,开始指控中国公司利用模型蒸馏(Model Distillation)技术窃取知识产权,并游说了美国官员。据报道,美国财政部等部门已开始考虑对部分中国开源 AI 模型实施禁用等措施。

此举也导致了硅谷初创公司的恐慌。近 200 家公司、投资机构火速组成的「小科技联盟(Little Tech Association)」警告政府:如果封杀廉价的开源模型,初创公司将被迫向 OpenAI 和 Anthropic 支付高昂的 API 费用,这将直接摧毁大量资金有限的美国创业公司。

黄仁勋在 X 平台的首秀,没有秀 GPU、没有发大模型,直接是一纸联名公开信,力挺开放权重 AI,足以见得硅谷大佬对于开源模型遇阻的担忧,将这场关于「开源 vs 闭源」的路线之争推向了高潮。

这场打压开源的大戏,究竟会发展成什么样?

参考内容:

Open Weights and American AI Leadership

文章来自于微信公众号 “机器之心”,作者 “机器之心”

刚刚,黄仁勋首次发推:半个硅谷,力挺Kimi K3开源最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
https://www.qske.com/news/%e5%88%9a%e5%88%9a%ef%bc%8c%e9%bb%84%e4%bb%81%e5%8b%8b%e9%a6%96%e6%ac%a1%e5%8f%91%e6%8e%a8%ef%bc%9a%e5%8d%8a%e4%b8%aa%e7%a1%85%e8%b0%b7%ef%bc%8c%e5%8a%9b%e6%8c%bakimi-k3%e5%bc%80%e6%ba%90/feed/ 0
深度|Vivix 灵动时刻发布首个实时互动模型 :统一多模态参考、交互与流式生成 https://www.qske.com/news/%e6%b7%b1%e5%ba%a6%ef%bd%9cvivix-%e7%81%b5%e5%8a%a8%e6%97%b6%e5%88%bb%e5%8f%91%e5%b8%83%e9%a6%96%e4%b8%aa%e5%ae%9e%e6%97%b6%e4%ba%92%e5%8a%a8%e6%a8%a1%e5%9e%8b-%ef%bc%9a%e7%bb%9f%e4%b8%80%e5%a4%9a/ https://www.qske.com/news/%e6%b7%b1%e5%ba%a6%ef%bd%9cvivix-%e7%81%b5%e5%8a%a8%e6%97%b6%e5%88%bb%e5%8f%91%e5%b8%83%e9%a6%96%e4%b8%aa%e5%ae%9e%e6%97%b6%e4%ba%92%e5%8a%a8%e6%a8%a1%e5%9e%8b-%ef%bc%9a%e7%bb%9f%e4%b8%80%e5%a4%9a/#respond Fri, 24 Jul 2026 15:07:00 +0000 https://www.qske.com/news/%e6%b7%b1%e5%ba%a6%ef%bd%9cvivix-%e7%81%b5%e5%8a%a8%e6%97%b6%e5%88%bb%e5%8f%91%e5%b8%83%e9%a6%96%e4%b8%aa%e5%ae%9e%e6%97%b6%e4%ba%92%e5%8a%a8%e6%a8%a1%e5%9e%8b-%ef%bc%9a%e7%bb%9f%e4%b8%80%e5%a4%9a/ 7 月 24 日,Vivix 正式发布两款激活参数约 30B 的模型 Vivix-A1(开放世界演员)和 Vivix-W1(开放世界剧情)。这次发布试图回答的问题不是"生成能不能更快",而是更前一步的:模型在持续生成音视频的同时,能不能随时接住用户的新输入,并即时改变正在生成的内容?

深度|Vivix 灵动时刻发布首个实时互动模型 :统一多模态参考、交互与流式生成最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
“实时”可能是过去一年AI领域被用得最滥的词。实时语音、实时换脸、实时风格迁移——但仔细看,绝大多数“实时”仍然是一个加速版的请求-响应循环:给一个条件,快速返回一个结果,再给下一个。模型输出时用户无法介入,用户操作时模型已经停了。用一个更精确的技术词汇描述:半双工。

7 月 24 日,Vivix 正式发布两款激活参数约 30B 的模型 Vivix-A1(开放世界演员)和 Vivix-W1(开放世界剧情)。这次发布试图回答的问题不是”生成能不能更快”,而是更前一步的:模型在持续生成音视频的同时,能不能随时接住用户的新输入,并即时改变正在生成的内容?

深度|Vivix 灵动时刻发布首个实时互动模型 :统一多模态参考、交互与流式生成

如果能,AI内容的基本单位就不再是一段离线生成好的素材,而是一段可以被持续改变的实时互动体验。Vivix 此次发布覆盖从基座模型、生成算法、NVFP4 量化到实时推理引擎的完整技术栈——但在拆解技术之前,先看它实际跑出来的效果。

官方现已开放内测,欢迎访问官网及 API 开放平台申请体验:https://vivix.ai/

能做到什么:从三个场景说起

Vivix 此次展示了 A1 和 W1 在几个方向上的 Demo,直接用效果来回答“实时交互的模型到底长什么样”。

直播电商:数字主播有了活人感

深度|Vivix 灵动时刻发布首个实时互动模型 :统一多模态参考、交互与流式生成

A1 生成的数字主播可以自由转身、自然地与商品互动,表情丰富且能即时应变。和此前常见的数字人直播相比,最明显的区别是角色不再被“钉”在固定机位里对口型——它有完整的全身动作,能走动、转向、拿起物体。运营人员可以在直播过程中通过语音调整方向,角色在自然的语句间隙完成切换,不需要中断重来。

AI 女友:动作、表情、声音自然同步

深度|Vivix 灵动时刻发布首个实时互动模型 :统一多模态参考、交互与流式生成

这个场景下观感上最突出的一点是,角色的动作、表情与语音确实是同步的,看不出分别输出再拼接的痕迹。技术上,这来自 A1 的原生多模态建模方式:模型不经过语音识别文本作为中间表示,而是直接在多模态信号空间里完成感知和生成——语音语义、声学特征、环境声音、手势和视觉信号被统一建模,感知结果直接驱动角色行为,绕开了从语音识别到语言模型再到动作生成的级联架构。

在直播过程中通过语音调整方向,角色在自然的语句间隙完成切换,不需要中断重来。

互动影视:一句话开启一场实时演进的故事

深度|Vivix 灵动时刻发布首个实时互动模型 :统一多模态参考、交互与流式生成

这个场景侧重展示的是 W1 的能力。只需输入一句“外星人入侵地球”,W1 就会随即生成一段持续展开的音视频故事。内容开始生成后,用户仍可以通过语音、文字、上传图片、点击或触控参与其中,实时改变故事走向。镜头切换、角色反应、对白、环境音和多镜头叙事在同一个生成过程中被原生协调,画面与声音同步产出,而非依赖预设分支或后期拼接。交互响应延迟低于 1 秒。

为什么是两个模型

A1 是一个面向交互式 AI 角色的实时全双工模型。它开创性地支持完整全身角色生成与全身动作生成——过去的数字人主要负责把话说出来,A1 开始让数字人把事情做出来。角色不仅可以说话,还能行走、听见环境、产生情绪、改变姿态、跳舞、接近或拿起物体。用户中途用语音打断,角色的动作和回应随之改变,无需重新生成。之所以能做到这一点,是因为 A1 并非 ASR + LLM + TTS 的串联,而是原生多模态生成循环——语音、文字和图片不是一次性给定的条件, 而是在互动中持续进入模型,中途改变角色正在做的事。

W1 则面向互动叙事。它的核心不是生成一个静态空间,而是生成一段持续变化的音视频故事。故事开始后,用户的语音、文字、点击、触控等操作持续进入模型,镜头切换、角色反应、环境音和剧情走向随之改变——这些不是后期拼接,而是模型原生同步生成的。 交互响应延迟低于1秒。

A1 做人,W1 做故事——这个拆分不只是优先级选择,也是能力依赖关系。人类在消费短视频、短剧和游戏时,70% 到 80% 的注意力与人有关,角色是一切叙事的锚点。A1 先解决单个数字角色的行动力问题——全身运动、物体交互、实时响应。W1 在此基础上解决的是多角色、多镜头的叙事调度:当单个角色已经能自主行动,才有可能让一个“导演”去协调多个角色之间的事件、对白和镜头关系,推动故事持续演进。换句话说,A1 是 W1 的基础能力单元。

在数据管线层面,两款模型共享同一套基础设施。Vivix 围绕“观测-交互-生成”构建交互数据三元组,通过数十个专项训练的专家模型完成自动化数据筛选与标注,目前已积累与头部视频模型相当规模的精标数据。

绕不开的四个技术问题

从效果倒推回去,Vivix 这套系统要跑通,绕不开四个依次递进的技术瓶颈。

怎么让模型在生成过程中接受新输入

目前主流的视频模型是 clip-based 架构,依赖固定时间窗口和双向 Attention,先看完全部输入再整体规划输出——画质好,但生成过程中没法塞进新指令。A1 和 W1 走的是因果生成:当前帧看不到未来,模型逐帧往前推。好处是随时能接住新输入,难处是没有全局信息兜底,角色身份、物体关系、动作连贯性全靠模型自己在线维护。Vivix 把多模态参考注入、因果时序建模和流式状态维护做进了同一套架构里,让图片、语音、文字等信号在生成链路中持续起作用,而不只第一帧。

因果生成能交互了,但不够快

视频扩散去噪通常要 4 到 8 步。直觉上砍步数就能提速,但 Vivix 在 W1-Turbo 评测中发现事情没这么简单——直接减步会同时带来动态性下降、细节丢失和长期漂移。不同去噪阶段分别承载语义、运动、细节和时序信息,每一步承载的能力维度不同,砍掉任何一步都不是在去冗余,而是在丢能力。他们为此设计了 MJD(Multidimensional Joint Distillation)蒸馏框架,按去噪阶段的能力分布做联合压缩,把扩散过程从约 8 步压到 2 步,评测中维持了 8 步基线下的运动表现和长期稳定性。

速度够了,30B 激活参数的算力成本还是太高

4-bit 量化是常见的降本手段,但用在视频扩散模型上比语言模型难得多。语言模型逐 token 生成,量化偏差基本各管各的;视频扩散去噪是连续过程,一步的微小偏差会沿时间轴一路传下去,生成越长漂得越远。训练完再做量化(PTQ)堵不住这个口子。Vivix 的做法是反过来,以 Blackwell NVFP4 GEMM 为目标推理路径,在训练阶段就让模型适配 4-bit 数值分布,同时加入专门的去噪误差校正抑制偏差的跨帧传导。据其披露,FP4 推理相对 BF16 基线生成质量近乎无损。

模型够快了,系统调度跟不上

近期市面上陆续出现一些近似实时推理的视频生成模型,包括一系列实时视频“世界模型”。他们的实现方式通常是基于小参数量(如1~5B)或较大的 VAE 压缩比(如16x16x8)来实现,牺牲了模型的 capacity,导致模型效果要么不能有大运动,要么就会频繁出现较大 artifacts。

从技术博客中我们看到 Vivix 本次发布的两个模型的有效激活参数接近 30B,并采用了 8x8x4 的高质量压缩率,计算下来每秒 token 吞吐需要做到前述工作的数十倍,这对模型推理成本和实时性带来了极大挑战。

为了稳稳接住这条实时链路,Vivix 还推出了 VMI,也就是 Vivix Model Infra。VMI(Vivix Model Infra)把多模态编码和逐帧解码拆成两个独立服务——编码端吃大 batch 求吞吐,解码端跑实时链路求低延迟,两条线互不干扰。这个解耦直接影响打断体验:用户中途说了句新指令,系统直接在解码链路里追加新输入,当前生成不需要中断重来。执行引擎通过 CUDA Graphs 统一提交、计算通信融合至 Mega Kernel,在消费级GPU 上跑出单卡超 10,000 video tokens/s,PCIe 带宽利用率 88% 以上。

在 Vivix-Bench 的 1000 样本人工评测中,A1 在运动动态和音画同步维度上相对现有方案有明显优势,在一致性维度上基本持平——这组数据提供了一个独立于官方指标之外的参考。

在消费级显卡配置下,上述系统的实测表现:首帧延迟(TTFF)< 0.6 秒,端到端延迟(TTFR)< 1.7 秒,原生打断 300-900 毫秒,实时推理成本低于每小时 1 美元(官方测试口径)。近 30B 激活参数模型在消费级显卡实时运行。

写在发布之后

A1 和 W1 并非没有局限——A1 在复杂快速运动和精细物体交互中仍有改进空间,W1 的实时版本在视觉质感上与头部离线视频模型仍有差距。Vivix 对此并不回避。

但近 30B 激活参数、2-Step Diffusion、消费级卡实时生成——A1 作为本次正式交付核心已上线 API,W1 以 Demo 形式展示能力,平台将在后续阶段逐步开放。Vivix 交付的不是一个交互概念,而是一套已经运行起来的原生流式多模态模型。这个方向是否成立,开发者现在可以自己去 API 上验证了。

文章来自于微信公众号 “Z Potentials”,作者 “Z Potentials”

深度|Vivix 灵动时刻发布首个实时互动模型 :统一多模态参考、交互与流式生成最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
https://www.qske.com/news/%e6%b7%b1%e5%ba%a6%ef%bd%9cvivix-%e7%81%b5%e5%8a%a8%e6%97%b6%e5%88%bb%e5%8f%91%e5%b8%83%e9%a6%96%e4%b8%aa%e5%ae%9e%e6%97%b6%e4%ba%92%e5%8a%a8%e6%a8%a1%e5%9e%8b-%ef%bc%9a%e7%bb%9f%e4%b8%80%e5%a4%9a/feed/ 0
姚顺雨领军,腾讯合并大语言模型和多模态团队 https://www.qske.com/news/%e5%a7%9a%e9%a1%ba%e9%9b%a8%e9%a2%86%e5%86%9b%ef%bc%8c%e8%85%be%e8%ae%af%e5%90%88%e5%b9%b6%e5%a4%a7%e8%af%ad%e8%a8%80%e6%a8%a1%e5%9e%8b%e5%92%8c%e5%a4%9a%e6%a8%a1%e6%80%81%e5%9b%a2%e9%98%9f/ https://www.qske.com/news/%e5%a7%9a%e9%a1%ba%e9%9b%a8%e9%a2%86%e5%86%9b%ef%bc%8c%e8%85%be%e8%ae%af%e5%90%88%e5%b9%b6%e5%a4%a7%e8%af%ad%e8%a8%80%e6%a8%a1%e5%9e%8b%e5%92%8c%e5%a4%9a%e6%a8%a1%e6%80%81%e5%9b%a2%e9%98%9f/#respond Fri, 24 Jul 2026 14:57:00 +0000 https://www.qske.com/news/%e5%a7%9a%e9%a1%ba%e9%9b%a8%e9%a2%86%e5%86%9b%ef%bc%8c%e8%85%be%e8%ae%af%e5%90%88%e5%b9%b6%e5%a4%a7%e8%af%ad%e8%a8%80%e6%a8%a1%e5%9e%8b%e5%92%8c%e5%a4%9a%e6%a8%a1%e6%80%81%e5%9b%a2%e9%98%9f/ 近日,腾讯宣布混元多模态模型部门与大语言模型部门合并,成立基础模型部,统一由腾讯首席AI科学家姚顺雨管理,以进一步提升模型研发和协同效率,探索全模态模型的智能上限。

姚顺雨领军,腾讯合并大语言模型和多模态团队最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
近日,腾讯宣布混元多模态模型部门与大语言模型部门合并,成立基础模型部,统一由腾讯首席AI科学家姚顺雨管理,以进一步提升模型研发和协同效率,探索全模态模型的智能上限。

姚顺雨领军,腾讯合并大语言模型和多模态团队

姚顺雨(右) 资料图

此次合并,意味着腾讯混元自2025年4月实行的大语言、多模态双团队并行研发模式正式结束。腾讯方称,此次合并是为了进一步提升模型研发和协同效率,探索全模态模型的智能上限。

姚顺雨于2025年9月从OpenAI低调加入腾讯,于12月担任腾讯首席AI科学家,统筹混元大语言模型研发。入职近一年来,他推动混元完成了底层基础设施全面重建。当前混元已形成以语言模型为基础,覆盖图像、视频、语音、3D生成等完整模型矩阵。

7月初正式发布并开源的大语言模型Hy3,采用MoE架构,总参数295B、激活参数21B,相比4月发布的preview版本在智能体和代码能力提升20-30%;且在同等参数量级下性能测评领先,并可比肩参数规模达其2至5倍的旗舰模型。

Hy3已在WorkBuddy/CodeBuddy、元宝、Marvis、ima等多款业务中接入,API同步上线腾讯云TokenHub及多个海外平台。发布首周,Hy3总调用量较上一代Hy2增长超过68倍;在WorkBuddy自选模型的用户中,选择Hy3的占比达60%

多模态模型方面,腾讯4月发布并开源的混元3D世界模型2.0(Hy World 2.0)支持文本、图片、视频等多类型输入,可自动生成、重建和模拟3D世界,并兼容多种格式的3D资产导出,能够与现有游戏工作流无缝对接,社区下载量已超300万。此外,混元图像模型3.0在LMArena榜单中位居国内开源模型第一。

伴随多模态业务的发展,相关人才变动也在持续。此前7月8日,前OpenAI研究员、姚顺雨的前同事田永龙加入腾讯大语言模型部。田永龙的过往研究对视觉模型及多模态表征学习的发展产生了广泛影响,他的加入有望为下一代混元多模态模型的发展提供技术支撑。

文章来自于微信公众号 “长安街知事”,作者 “长安街知事”

姚顺雨领军,腾讯合并大语言模型和多模态团队最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
https://www.qske.com/news/%e5%a7%9a%e9%a1%ba%e9%9b%a8%e9%a2%86%e5%86%9b%ef%bc%8c%e8%85%be%e8%ae%af%e5%90%88%e5%b9%b6%e5%a4%a7%e8%af%ad%e8%a8%80%e6%a8%a1%e5%9e%8b%e5%92%8c%e5%a4%9a%e6%a8%a1%e6%80%81%e5%9b%a2%e9%98%9f/feed/ 0
美国牧师起诉 OpenAI:称 ChatGPT 的健康建议,差点要了他的命 https://www.qske.com/news/%e7%be%8e%e5%9b%bd%e7%89%a7%e5%b8%88%e8%b5%b7%e8%af%89-openai%ef%bc%9a%e7%a7%b0-chatgpt-%e7%9a%84%e5%81%a5%e5%ba%b7%e5%bb%ba%e8%ae%ae%ef%bc%8c%e5%b7%ae%e7%82%b9%e8%a6%81%e4%ba%86%e4%bb%96%e7%9a%84/ https://www.qske.com/news/%e7%be%8e%e5%9b%bd%e7%89%a7%e5%b8%88%e8%b5%b7%e8%af%89-openai%ef%bc%9a%e7%a7%b0-chatgpt-%e7%9a%84%e5%81%a5%e5%ba%b7%e5%bb%ba%e8%ae%ae%ef%bc%8c%e5%b7%ae%e7%82%b9%e8%a6%81%e4%ba%86%e4%bb%96%e7%9a%84/#respond Fri, 24 Jul 2026 14:57:00 +0000 https://www.qske.com/news/%e7%be%8e%e5%9b%bd%e7%89%a7%e5%b8%88%e8%b5%b7%e8%af%89-openai%ef%bc%9a%e7%a7%b0-chatgpt-%e7%9a%84%e5%81%a5%e5%ba%b7%e5%bb%ba%e8%ae%ae%ef%bc%8c%e5%b7%ae%e7%82%b9%e8%a6%81%e4%ba%86%e4%bb%96%e7%9a%84/ 7月22日,美国佛罗里达州的牧师 Scott Winters,在旧金山把 OpenAI 和它的 CEO Sam Altman 告了。Winters 称自己在 2025 年夏天身体开始不对劲,症状持续有六个星期,这期间他没往医院跑,而是一遍遍去问 ChatGPT-4o 。可他后来才知道,那些被他反复描述的症状,其实是肺栓塞的征兆。血块堵在肺部血管里,随时会要命。

美国牧师起诉 OpenAI:称 ChatGPT 的健康建议,差点要了他的命最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
一个牧师,因为信了ChatGPT-4o 的话,拖了六个星期没去医院,差点把命搭进去,最后把 OpenAI 告上了法庭。

事情是这样的。

7月22日,美国佛罗里达州的牧师 Scott Winters,在旧金山把 OpenAI 和它的 CEO Sam Altman 告了。

美国牧师起诉 OpenAI:称 ChatGPT 的健康建议,差点要了他的命

Winters 称自己在 2025 年夏天身体开始不对劲,症状持续有六个星期,这期间他没往医院跑,而是一遍遍去问 ChatGPT-4o 。

ChatGPT-4o 也一遍遍地安抚他,并告诉他这些症状“没什么危险”,不值得为它专门去看医生。

可他后来才知道,那些被他反复描述的症状,其实是肺栓塞的征兆。血块堵在肺部血管里,随时会要命。

Winters 是牧师,信仰很深,而 ChatGPT-4o 好像「摸准」了这一点,顺着他的信仰对他讲:“上帝不会把你的身体设计成不停垮下去的样子。”

鼓励式回应他继续与AI互动,也没有提供警告或寻求紧急医疗救助的指示。

就这么一来一回,自己的信仰把自己坑了。

家里人也劝过他去医院,可 ChatGPT-4o 那种笃定的、权威的口气,让他一次次把家人的话放到了一边。

直到发作了肺栓塞,他才幡然醒悟去了医院。

他认为ChatGPT-4o 对风险的淡化和对就医的劝阻,影响了他的决定,害自己不但差点丢掉性命,工作、教会、家,也跟着全没了。

当然这都是 Winters 单方面的说法,案子 7 月才刚起诉,没开庭、更没判过,到底是不是 ChatGPT 的责任,法院还没有结论。

就在他告状的第二天,OpenAI 做了一件事。

◈诉讼的第二天,ChatGPT 开始读病历了

7 月 23 日,OpenAI 向美国的成年用户开放了一个叫 ChatGPT Health (健康助手)的功能。

用户可以把自己的医疗记录、Apple Health 里的数据、甚至手环的运动睡眠记录全接进 ChatGPT。

美国牧师起诉 OpenAI:称 ChatGPT 的健康建议,差点要了他的命

接进去之后,它可以把化验单上那堆医学缩写和箭头翻译成能看懂的话,把这次检查和上次的结果放在一起对比,告诉我们哪些指标在变好哪些在走坏,甚至帮我们在看病前整理出一份“该问医生什么”的清单。

据统计目前每周有 3 亿用户使用 ChatGPT 进行健康咨询,新功能可让 ChatGPT 理解个人健康上下文,追踪变化并提供更个性化的帮助。

换作以前,我可能会觉得这功能挺好,谁没对着一张化验单发过呆、对着一串上上下下的箭头瞎猜过?

可这次,我第一反应不是想用,是怀疑,是警惕。

因为它掌握的关于一个人的信息越多,说出来的话就越顺、越贴合、越像那么回事。而人在身体出问题、心里发慌的时候,最扛不住的,恰恰就是这种”像那么回事”。

我为什么这么警惕?因为这个坑,我一个月前才刚踩过。

◈我的胳膊,被 AI 误诊了

前段时间我的胳膊上冒了一片东西,红红的,痒,还脱皮。就拍了张照丢给 AI 问了一句。

它答得那叫一个利索:像体癣,真菌感染,抹点抗真菌药膏就行。

连药膏怎么涂、涂几天、多久见效都给安排得明明白白。我信了,一点没犹豫,这不就芝麻大的事嘛,跑去药店买了药就开涂。

涂了三四天,没动静。又涂几天,不但没好,还更痒了。

最离谱的是我当时的反应。我居然没怀疑它错了,怀疑的是我自己:“是不是涂得不够勤?是不是这牌子的药不行?”

我又回去问它,它还是顺着体癣那套接着给我出主意。就这么被自己说服着,又拖了小一个礼拜。

拖到实在受不了,才去医院。医生瞅了一眼,问了两句,直接说:这不是体癣,是湿疹。俩病长得是有点像,可根上就不是一回事,药也完全用反了方向。

后来我特意查了才明白,体癣和湿疹在外观上确实容易混,所以医生根本不会只“看一眼”就下判断,得结合情况、必要时刮点皮屑放显微镜底下瞧瞧到底有没有真菌,才能分清是哪个。

美国牧师起诉 OpenAI:称 ChatGPT 的健康建议,差点要了他的命

而 AI 隔着一张照片,给的那段话条理清楚、症状也对得上,听着挑不出毛病。

可”听着没毛病”和”真没毛病”之间,隔的正是医生要做的那一堆鉴别动作,这些它做不了。

◈写在最后

写到这我特意去查了下,才发现在看病这件事上信 AI 的,远不止我一个。

美国盖洛普与 West Health 在 2026 年发布的一项调查显示,不少人会在看医生前后用 AI 查健康问题:18–29 岁的 AI 用户里,有 59% 会在就医前先用 AI 自己研究一番;哪怕是 65 岁及以上的人群,也有 43% 这么做。

美国牧师起诉 OpenAI:称 ChatGPT 的健康建议,差点要了他的命

这么一看,牧师那样的事、我胳膊上那样的事,其实每天都在很多人身上发生,只是大多数人运气好,没闹到上法庭,也没留下什么后怕。

我其实不觉得AI健康助手是什么坏东西,它整理信息是把好手,可诊断这一步,它替谁都决定不了。

所以最后,我特别想听听大家的:

你有没有拿 AI 问过自己身上的毛病?你信了几分?

参考文献

[1] Tech Justice Law:诉讼代理方公告与诉状链接: https://techjusticelaw.org/press-releases/pastor-sues-after-openai-ai-chatgpt-allegedly-discouraged-him-from-seeking-medical-care-during-life-threatening-blood-clots/

[2] OpenAI Release Notes:Health in ChatGPT(2026-07-23): https://help.openai.com/en/articles/6825453-chatgpt-release-notes

[3] OpenAI:Introducing ChatGPT Health: https://openai.com/index/introducing-chatgpt-health/

[4] CBS News:诉讼报道: https://www.cbsnews.com/news/chatgpt-dangerous-medical-advice-openai-lawsuit/

[5] The Verge:ChatGPT Health 隐私报道: https://www.theverge.com/report/866683/chatgpt-health-sharing-data

[6] Gallup & West Health(2026):用户就医前后使用 AI 查询健康信息的调查: https://news.gallup.com/

文章来自于微信公众号 “夕小瑶科技说”,作者 “夕小瑶科技说”

美国牧师起诉 OpenAI:称 ChatGPT 的健康建议,差点要了他的命最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
https://www.qske.com/news/%e7%be%8e%e5%9b%bd%e7%89%a7%e5%b8%88%e8%b5%b7%e8%af%89-openai%ef%bc%9a%e7%a7%b0-chatgpt-%e7%9a%84%e5%81%a5%e5%ba%b7%e5%bb%ba%e8%ae%ae%ef%bc%8c%e5%b7%ae%e7%82%b9%e8%a6%81%e4%ba%86%e4%bb%96%e7%9a%84/feed/ 0
VC锚定AI社区生态,SeaArt完成超亿元B轮融资 https://www.qske.com/news/vc%e9%94%9a%e5%ae%9aai%e7%a4%be%e5%8c%ba%e7%94%9f%e6%80%81%ef%bc%8cseaart%e5%ae%8c%e6%88%90%e8%b6%85%e4%ba%bf%e5%85%83b%e8%bd%ae%e8%9e%8d%e8%b5%84/ https://www.qske.com/news/vc%e9%94%9a%e5%ae%9aai%e7%a4%be%e5%8c%ba%e7%94%9f%e6%80%81%ef%bc%8cseaart%e5%ae%8c%e6%88%90%e8%b6%85%e4%ba%bf%e5%85%83b%e8%bd%ae%e8%9e%8d%e8%b5%84/#respond Fri, 24 Jul 2026 10:11:00 +0000 https://www.qske.com/news/vc%e9%94%9a%e5%ae%9aai%e7%a4%be%e5%8c%ba%e7%94%9f%e6%80%81%ef%bc%8cseaart%e5%ae%8c%e6%88%90%e8%b6%85%e4%ba%bf%e5%85%83b%e8%bd%ae%e8%9e%8d%e8%b5%84/ 近日,全球化AI互动娱乐平台海艺(SeaArt)宣布完成超亿元B轮融资。本轮融资由视觉中国、华盖创赢、祥峰投资联合领投,广发信德、天投资本、川创投、广州合伟永晟跟投。此前海艺曾获阿里、腾讯、招银国际、钟鼎资本、Actoz、上海人工智能产业系列基金、和溋资本等知名产业基金和财务投资机构加持。

VC锚定AI社区生态,SeaArt完成超亿元B轮融资最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
不再烧钱换规模后,VC锚定AI社区生态

近日,全球化AI互动娱乐平台海艺(SeaArt)宣布完成超亿元B轮融资。本轮融资由视觉中国、华盖创赢、祥峰投资联合领投,广发信德、天投资本、川创投、广州合伟永晟跟投。此前海艺曾获阿里、腾讯、招银国际、钟鼎资本、Actoz、上海人工智能产业系列基金、和溋资本等知名产业基金和财务投资机构加持。

在AI应用投融资明显降温的背景下,这笔融资本身就足够引人关注,但更值得注意的是视觉中国以领投方身份入局。

过去几年,生成式AI与版权机构更多时候站在讨论的两端:一边是AI内容快速爆发,一边是版权保护不断升级。

如今,一家头部视觉版权平台选择重仓一家AI原生内容社区,这一变化本身就释放出一个值得关注的行业信号——资本正在重新评估AI应用的长期价值。

从聊天助手、AI绘画到AI视频,再到Agent,过去两年,大量产品涌现,有快速爆发也有残酷的淘汰。用户规模、下载量、DAU曾是资本判断项目最重要的指标,“算力补贴换增长”是标准动作。

但“规模神话”在AI领域失效了,市场开始重新追问一个问题:AI应用真正的护城河究竟是什么?

海艺的融资恰好发生在这一节点,它更像是资本对AI应用价值重估的一次缩影。

AI内容平台,出现新的估值锚点

过去一年,一个越来越明显的趋势正在出现:单点AI产品越来越容易被平台能力吸收。

无论是OpenAI 关停Sora把能力收回ChatGPT,还是各大模型厂商不断扩展原生能力边界,都意味着,模型能力正在快速普惠,功能创新带来的窗口期越来越短。

对于AI应用来说,一个新功能能够建立的竞争优势,正在以月甚至以周为单位缩短。这意味着,工具仍然重要,但已经越来越难成为一家公司的长期壁垒。

市场开始寻找另一种更难复制的价值。答案开始从工具本身,转向内容资产、创作者生态和用户关系。

海艺的发展路径,正是围绕这一逻辑展开。

过去三年,SeaArt并没有停留在一款AI绘图工具。围绕AI角色创作,平台持续沉淀模型、LoRA、工作流、模板、Agent等超过200万个AI原生创作资产,并聚集全球创作者持续生产内容,逐步形成一个不断生长的PUGC内容社区。

不再烧钱换规模后,VC锚定AI社区生态

在SeaArt社区里,底层复杂的模型参数、LoRA、ControlNet等技术细节,被封装成了可复用的工作流与模板,鼓励创作者售卖个人审美、调性与世界观。当一名普通用户调用一个成熟的“赛博朋克光影”工作流,他是在消费和复用一位资深创作者数百小时的调试经验。

不再烧钱换规模后,VC锚定AI社区生态

经验资产化极大地降低了优质内容生产的边际成本,也让AI创作从“手搓作坊”向“工业标准化”过渡。目前,平台上已有超过200万个AI原生创作SKU,头部创作者月收入可达数千美元。

这也使得SeaArt成功在应用层建立了两道护城河:通过圈层筛选和运营产生的高粘性,对抗底层模型的快速迭代,是第一道护城河;而更深层的护城河在于难以被技术参数量化的“文化审美壁垒”,基于用户与创作者高频互动生长出来的“审美共识”是无法被轻易复制的。

基于这套方法论,海艺发布了定位于AI短剧消费产品MoreShort,以及AI角色互动产品SeaSoul。

在国内AI短剧还在卷生成画质、拼投流ROI的时候,海艺旗下的MoreShort悄悄跑通了另一条路——别人卖的是“生成能力”,MoreShort卖的是“内容体验”。这款产品不需要用户很懂提示词、调参数,而是专注于让用户为故事和角色付费,直接把AI内容的受众从专业创作者圈层,拓展到了普通消费用户。

而且,MoreShort并不是一个孤立的爆款产品,而是海艺AI IP生态里的关键变现节点。它的护城河从来不是生成技术,而是社区沉淀的内容资产、创作者的深度绑定、海外本地化的运营能力。这些东西,参数堆不出来,模型升级也带不走,恰恰是当下AI应用最稀缺的“软壁垒”。

再来说说海艺的另一款产品——SeaSoul。很多人会把SeaSoul简单等同于AI聊天陪伴产品,但二者的底层逻辑根本不在一个维度。市面上多数AI角色产品,本质还是“大模型+人设提示词”的拼接玩法,而SeaSoul的角色供给,直接扎根在SeaArt社区的200万创作资产里——创作者在SeaArt里打磨的角色形象、世界观、视觉风格甚至分镜工作流,可以迁移到SeaSoul中变成可互动的数字个体。

换句话说,很多AI社交软件虚构的味道太浓,但SeaSoul的角色是基于用户想象而真实创作出的东西。这套逻辑背后是一整套PUGC创作者生态的持续供给,从根源上缓解了AI陪伴产品“角色同质化、新鲜感消退快”的通病,也让它跳出了纯大模型公司的同质化竞争。

不再烧钱换规模后,VC锚定AI社区生态

在海艺的生态中,上游SeaArt负责角色生产与世界观搭建,是整个生态的内容源头;中游MoreShort通过AI短剧完成故事消费与初步变现,完成IP的第一次商业化;下游SeaSoul承接IP热度,让用户和角色建立长期情感连接,进一步拉长用户生命周期。

这套逻辑和游戏行业“IP+内容+社群”的打法如出一辙,只不过载体换成了AI。

游戏方法论,在AI时代重新升值

海艺的发展路径,与团队背景密切相关。

创始团队来自游戏行业,经历过中国游戏出海最激烈的竞争周期。2020年至2023年,团队旗下产品曾跻身中国游戏出海收入榜前30,在全球发行、内容运营、商业循环、多语言本地化等方面积累了深厚的基本功。这套方法论并非 AI 时代的新生事物,却在当下的行业环境中重新凸显出价值。

原因在于,游戏与AI内容平台有着相似的底层逻辑:技术能力决定下限,对人性的洞察决定上限。

对此,海艺将SLG等高复杂度游戏领域积累的运营经验,移植到了AI社区的搭建中,进而激发用户更丰富的个性化表达,在高竞争的环境下同时把控研发、长期运营和创作者生态管理。

相比追逐短期流量,海艺更早开始围绕AI角色构建内容供给、内容消费和互动关系,而不是停留在单一工具的使用场景。

这种方法论,也塑造了海艺与多数AI公司截然不同的发展节奏。

在游戏行业,ROI是刻在骨子里的逻辑——每一分钱买量都要算回报,每一个用户的生命周期价值都要被精确衡量。这种思维让海艺在AI赛道启动时,天然避开了“烧钱换规模”的诱惑。

当行业普遍用补贴催生短期付费、用算力成本换取用户增长时,海艺选择先验证单位经济模型,再扩张。

这种“反主流”的选择,也体现在海艺的全球化策略上。

2023年,当多数多模态AI公司还只有英语版本时,海艺凭借此前游戏出海积累的多语言本地化能力,率先切入巴西、日本等非英语市场。

在巴西,海艺以“简单易上手”为核心卖点引爆口碑,建立规模效应和数据飞轮后,再反攻欧美等高价值市场。第一个100万MAU,正是从巴西这样的“全球化洼地”里长出来的。

这帮游戏出海老兵对内容消费的理解,加上另辟蹊径的全球化策略,成为这家公司能跳出“Token不经济”的关键。

过去几年,大多数AI产品围绕“效率”竞争,帮用户完成任务、节省时间(Save Time);而内容型产品竞争的,是占据用户时间(Kill Time)。

以海艺旗下的AI角色互动产品SeaSoul为例,这款产品上线仅4个月,日活即达到50万,人均单日在线时长超过66分钟。海艺平台的用户平均在线时长是同类产品的3倍以上,这让海艺表现得更像一个高粘性的在线游戏,而非创作工具。

不再烧钱换规模后,VC锚定AI社区生态

海艺的成绩单,并非源于大众所熟知的“爆款方法论”,而是策略上的积淀以及内容生态的搭建,这些远比一两款暴力增长的应用产品更有价值。

“规模陷阱”已经是公开的秘密

AI应用与移动互联网最大的不同,在于规模并不会天然创造价值。

在AI时代,每一次图片生成、每一段视频渲染、每一轮智能体对话,都在消耗实实在在的Token和算力。对于很多AI应用而言,新增一个活跃用户,并不意味着边际成本下降,反而意味着持续增加的推理成本、内容生成成本和运营成本。

因此,将规模作为第一目标也成为很多AI创业项目踩中的第一个陷阱。

仅靠“补贴换增长”很容易陷入“规模越大、亏损越大”的恶性循环,更可怕的是,当上游模型覆盖了更强的能力之后,中间层工具的价值就会瞬间归零。

如今,越来越多投资人开始用“Token不经济”概括这种现象:模型能力会持续进步,Token价格会不断下降,但Token消耗不会消失。如果每一次模型调用都无法持续创造价值,再大的用户规模也很难沉淀长期竞争力。

这也是为什么,资本讨论AI应用时,越来越少只谈MAU、DAU和下载量,转而开始关注另一组指标:用户付费、ARPPU、续费率、LTV,以及单位经济模型是否成立。

这些指标之所以重要,并不仅仅因为它们代表经营能力,而是它们正在验证另一件事情:一套AI生态是否具备持续运转、持续迭代的能力。

商业化不再只是增长之后需要解决的问题,而是生态能否持续演进的前提。换句话说,ARR决定估值下限,生态决定估值上限。

从公开披露的数据来看,SeaArt累计注册用户超过6500万,海外用户占比超过90%;平台整体毛利率超过40%,核心产品用户续费率约60%,ARPPU保持在较高水平。正毛利与高留存的组合,意味着海艺已经具备了穿越周期的商业化底色。

不再烧钱换规模后,VC锚定AI社区生态

更重要的是,对于投资人而言,它们是一组验证信号:海艺并没有停留在仅仅作为一款AI工具的获客阶段,而是在验证一套能够持续沉淀内容、聚集创作者、维系用户关系的生态模型。

资本押注的,是AI IP生态的未来

就AI应用层而言,模型能力仍会持续进步,但模型终将走向普惠,从而越来越难成为长期壁垒。真正能够沉淀下来的,是内容资产、创作者生态,以及围绕IP建立的用户关系。这些能力无法通过一次模型升级获得,只能依靠长期运营不断沉淀。

海艺正沿着这条路径布局:SeaArt负责角色生产,MoreShort连接故事消费,SeaSoul建立互动关系,未来的SeaVerse进一步延伸至多模态互动娱乐场景,构建完整的AI IP生态。

这种生态化思路,也与本轮投资方的产业资源形成了深度协同。视觉中国作为领投方,将在高质量版权数据、内容合规及B端商业化场景上为海艺补上关键拼图,推动其商业边界从C端娱乐消费向B端企业服务延伸。在AIGC版权秩序重构的当下,这种“从博弈到共建”的关系转变,可能成为行业新常态。

与此同时,海艺也在将其沉淀的基础设施向更轻量化的创作者开放:联合四川天府新区打造“天府T·OPC星海创业营”,为AIGC创作者提供算力、工具及政策支持,培育“一人公司”生态。创作者可以在统一的基础设施上完成从角色设定、视觉生成、剧情生产到商业化分发的全链路创作。

回望AI应用层的发展历程,从不缺风口上的故事,缺的是穿越周期的硬实力。海艺一开始便走了不一样的路:打磨单位经济模型,沉淀工业化能力,搭建生态化体系。

这套“质量优先”的增长逻辑,在行业回归理性的当下,反而显出了稀缺性。海艺这笔融资也表明,资本已经开始为下一代AI内容生态定价了。

AI时代当然还会诞生很多爆款产品,但真正值得平台估值的,终究不是爆款本身,而是持续创造爆款的生态。

文章来自于微信公众号 “虎嗅APP”,作者 “虎嗅APP”

VC锚定AI社区生态,SeaArt完成超亿元B轮融资最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
https://www.qske.com/news/vc%e9%94%9a%e5%ae%9aai%e7%a4%be%e5%8c%ba%e7%94%9f%e6%80%81%ef%bc%8cseaart%e5%ae%8c%e6%88%90%e8%b6%85%e4%ba%bf%e5%85%83b%e8%bd%ae%e8%9e%8d%e8%b5%84/feed/ 0
Claude Opus 5 偷跑,第一波网友实测来了 https://www.qske.com/news/claude-opus-5-%e5%81%b7%e8%b7%91%ef%bc%8c%e7%ac%ac%e4%b8%80%e6%b3%a2%e7%bd%91%e5%8f%8b%e5%ae%9e%e6%b5%8b%e6%9d%a5%e4%ba%86/ https://www.qske.com/news/claude-opus-5-%e5%81%b7%e8%b7%91%ef%bc%8c%e7%ac%ac%e4%b8%80%e6%b3%a2%e7%bd%91%e5%8f%8b%e5%ae%9e%e6%b5%8b%e6%9d%a5%e4%ba%86/#respond Fri, 24 Jul 2026 07:57:00 +0000 https://www.qske.com/news/claude-opus-5-%e5%81%b7%e8%b7%91%ef%bc%8c%e7%ac%ac%e4%b8%80%e6%b3%a2%e7%bd%91%e5%8f%8b%e5%ae%9e%e6%b5%8b%e6%9d%a5%e4%ba%86/ Opus 5提前泄露,网友已经把它测了一整轮。@chetaslua甩出的一段3D生成场景里,一台弹弓正对着城墙发射石弹,画面左侧还挂着弹道张力、箭矢重量这些参数卡片,还有各种细节,全都做得清清楚楚。

Claude Opus 5 偷跑,第一波网友实测来了最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
Opus 5提前泄露,网友已经把它测了一整轮。

@chetaslua甩出的一段3D生成场景里,一台弹弓正对着城墙发射石弹,画面左侧还挂着弹道张力、箭矢重量这些参数卡片,还有各种细节,全都做得清清楚楚。

Claude Opus5偷跑,第一波网友实测来了

他说,自己用Opus用了这么久,从没在一张画面里见过这种细节,哪怕多截几张图也凑不出同样的效果。

Claude Opus5偷跑,第一波网友实测来了

类似的反应这两天不断冒出来,有人甚至说自己愿意管它叫fable 6。

Claude Opus5偷跑,第一波网友实测来了

当然这条视频也不是孤例,这两天还有人不断甩出别的实测。

网友抢先开玩Opus 5

@chetaslua不是只发了一条视频。

同一天里,他又甩出一个天气卡界面,光影会随时间推移变化,晴天时太阳投在毛玻璃质感的面板上,云层飘过时阴影跟着挪动。

Claude Opus5偷跑,第一波网友实测来了

还有一间厨房的场景,里面冰箱贴、瓷砖缝隙、灶台上反光的水壶,一样不少。

他把这些效果归到一句话上,说自己用Opus用了这么久,头一次觉得three.js能做出这种质感。

Claude Opus5偷跑,第一波网友实测来了

甚至有网友发现,Opus 5对这个场景的处理,已经超过了fable。

@birdabo做了一次头对头对比。

同一个弹弓攻城的场景,他分别交给Opus 5和已经上线的Fable 5生成。

Fable 5虽然一次成型,但帐篷是纯色平面,草地没有起伏,弹弓本体也少了张力、箭矢重量这些参数面板,细节密度上肉眼可见地输了一截。

Claude Opus5偷跑,第一波网友实测来了

同一时间,@xikhar放出的是完全不同的场景——一段Minecraft复刻实测。

让模型复刻Minecraft,已经是一道经典考题了。

在博主展示的demo里,方块碎裂的物理效果、光照在表面投下的阴影都复刻得惟妙惟肖。

Claude Opus5偷跑,第一波网友实测来了

他后来又贴出一张PS5手柄的SVG图,摇杆、触控板、按键上的反光和阴影都做得像实物渲染图。

博主因此评价说,Opus 5“3D和2D都强”。

Claude Opus5偷跑,第一波网友实测来了

Opus 5已现端倪

关于Opus 5的泄露,比较早的痕迹出现在7月9日。

那天,一个叫Honeycomb EAP的代号,出现在Cursor的模型选择器里。

关键是,这个神秘模型和Opus 4.8、Sonnet 4.5并排列着,还标注了1M上下文窗口和一个叫“extra high effort”的档位。

几个小时后,这个神秘模型又消失不见。

Claude Opus5偷跑,第一波网友实测来了

7月14日,又有网友发帖说在Google Vertex AI的模型库里看到了Opus 5的条目。

这位博主估计模型最快周四就会正式发布,同时他也提了一句担心,怕Anthropic会拿这个当借口,把Fable 5从Claude订阅计划里撤下来。

Claude Opus5偷跑,第一波网友实测来了

第二天,另一位博主也发布了同样的消息。

Claude Opus5偷跑,第一波网友实测来了

昨天晚上,@M1Astra发了新帖,说Opus 5的前期准备痕迹又一次出现了。

不久之后他又追加一条,表示Opus 5已经开始在各家提供商那边陆续上线。

Claude Opus5偷跑,第一波网友实测来了

今早,他再次更新消息,表示部分用户已经用上了Opus 5,虽然页面显示的仍然是4.8,但输出差距十分明显。

Claude Opus5偷跑,第一波网友实测来了

以及在今天凌晨,有一张截图流出。

Claude Opus5偷跑,第一波网友实测来了

一位疑似Anthropic员工误发的截图显示,他在触发Fable 5的guardrail后,被系统路由到了Opus 5上。

Claude Opus5偷跑,第一波网友实测来了

还有在Cursor里,Opus 5也以实名形式出现。

具体出现的位置是报错弹窗,里面出现了“claude-opus-5-thinking-high”这串字符,弹窗提示说需要开启Max Mode才能使用。

Claude Opus5偷跑,第一波网友实测来了

按照一些网友的推论,Opus离正式上线已经不远了。

Fable 5平替?

这轮实测热闹起来的同时,Opus 5的性能能追平Fable 5的说法也开始盛传。

Claude Opus5偷跑,第一波网友实测来了

这个说法之所以让人心动,是因为Fable 5的定价是每百万token输入10美元、输出50美元,正好是Opus系列的两倍。

如果Opus 5真能追平Fable 5的水平,价格却停在Opus这一档,那就是一份便宜一半的平替。

不过截至目前,没有一份完整、可独立验证的跑分被公开过。

另外,整体用下来是不是更便宜,也不能只看单价。

开头提到的博主Chetaslua就表示,Opus 5吃token的速度比Fable 5还猛,三条prompt就把额度用光了。

Claude Opus5偷跑,第一波网友实测来了

如果token消耗真的如此巨大,那么单价的优势将会消失,便宜一半的期待,就成了泡影。

不过,Opus 5离发布应该不远了,到底能不能平替fable,再等等就知道了。

参考链接:

[1]https://x.com/chetaslua/status/2080290382315925911

[2]https://x.com/cheatyyyy/status/2080359098214953421

[3]https://x.com/M1Astra/status/2080246754104971356

[4]https://x.com/birdabo/status/2080340647622623315

文章来自于微信公众号 “量子位”,作者 “量子位”

Claude Opus 5 偷跑,第一波网友实测来了最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
https://www.qske.com/news/claude-opus-5-%e5%81%b7%e8%b7%91%ef%bc%8c%e7%ac%ac%e4%b8%80%e6%b3%a2%e7%bd%91%e5%8f%8b%e5%ae%9e%e6%b5%8b%e6%9d%a5%e4%ba%86/feed/ 0
首发| 华为盘古2号位创业做AI生成矢量3D模型,比特无限三个月估值涨10倍 https://www.qske.com/news/%e9%a6%96%e5%8f%91-%e5%8d%8e%e4%b8%ba%e7%9b%98%e5%8f%a42%e5%8f%b7%e4%bd%8d%e5%88%9b%e4%b8%9a%e5%81%9aai%e7%94%9f%e6%88%90%e7%9f%a2%e9%87%8f3d%e6%a8%a1%e5%9e%8b%ef%bc%8c%e6%af%94%e7%89%b9%e6%97%a0/ https://www.qske.com/news/%e9%a6%96%e5%8f%91-%e5%8d%8e%e4%b8%ba%e7%9b%98%e5%8f%a42%e5%8f%b7%e4%bd%8d%e5%88%9b%e4%b8%9a%e5%81%9aai%e7%94%9f%e6%88%90%e7%9f%a2%e9%87%8f3d%e6%a8%a1%e5%9e%8b%ef%bc%8c%e6%af%94%e7%89%b9%e6%97%a0/#respond Fri, 24 Jul 2026 07:57:00 +0000 https://www.qske.com/news/%e9%a6%96%e5%8f%91-%e5%8d%8e%e4%b8%ba%e7%9b%98%e5%8f%a42%e5%8f%b7%e4%bd%8d%e5%88%9b%e4%b8%9a%e5%81%9aai%e7%94%9f%e6%88%90%e7%9f%a2%e9%87%8f3d%e6%a8%a1%e5%9e%8b%ef%bc%8c%e6%af%94%e7%89%b9%e6%97%a0/ 3D打印无疑是全球增长最受关注的赛道之一,但结构化、可编辑的物理3D数据却极度稀缺。就在这个行业真空里,一家年轻公司浮出水面——AI生成矢量3D模型的比特无限(BitInf)。

首发| 华为盘古2号位创业做AI生成矢量3D模型,比特无限三个月估值涨10倍最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
通往物理3D「GPT时刻」。

如果你是3D打印爱好者,一定有过类似的经历:想给耳机设计一个分层收纳盒,翻遍模型库也找不到适配尺寸的现成方案。

市面上现有的解法,却各有硬伤。人工建模产能低、成本高,追赶不上工业和创客两端同时膨胀的需求;通用AI生成的3D模型则更像是一具“空壳”,内部没有尺寸标注,没有装配逻辑,改一个孔距就得全部重绘。放到仿真环境里物体会直接穿模,导出打印更是拼接不上。

3D打印无疑是全球增长最受关注的赛道之一,但结构化、可编辑的物理3D数据却极度稀缺。就在这个行业真空里,一家年轻公司浮出水面——AI生成矢量3D模型的比特无限(BitInf)。

不久前WAIC期间,央视对这家成立仅一年多的创业公司进行了报道,镜头对准的是一支全90后团队。一年前,有着多年海外AI To C创业经验的李士麒,敏锐捕捉到物理3D数据的空白,携手华为盘古大模型2号位周平义博士等前沿团队创办了比特无限。

构建真实世界的物理3D数据飞轮,比特无限跑出了一条独特路线:以3D打印与全球海量Makers为入口,自研模型Arko-T在文生物理3D任务上已达到全球SOTA水平,海外平台收获超百万曝光。

首发| 华为盘古2号位创业,三个月估值涨10倍

投资界获悉,继4月官宣种子轮后,比特无限又连续完成了天使轮与天使+轮融资,集结了卓源亚洲、容亿投资、普华资本、壹德资本等知名机构。“不到三个月,估值涨了10倍。”7月,投资界在上海模速空间见到比特无限CEO李士麒。

“谁能率先补齐物理3D数据短板,谁就能握住物理AI时代的入场券。”李士麒判断,生成式物理3D的GPT时刻已近在眼前。

95后率队华为盘古2号位

三个月估值涨10倍

今年6月,“AI教母”李飞飞发表长文,将世界模型拆解为三层结构:Renderer(渲染器)、Simulator(模拟器)和Planner(规划器)。

她认为,模拟器是其中影响最为深远的一环,输出的是一种在几何、物理和动力学上忠实呈现世界状态的结构化表达,可以作为人类和计算机程序进行计算的基础、交互的对象。机器人训练、自动驾驶测试、建筑可视化、工程仿真乃至药物研发,都依赖模拟器这个核心载体

几乎同一时间,峰瑞资本创始合伙人李丰也抛出了一个类似判断:世界模型和物理模型之所以成为具身智能领域最大的投资热点,根源在于“没有数据”——人类从来没有大规模积累过包含物理量和物理世界交互规律的数据。

稍早之前,李士麒便已看穿前沿行业的数据真空,深感构建自主可循环的数据引擎迫在眉睫,“我们需要一个能持续从‘真实世界意图与交互反馈’中产生数据的引擎。”

而回顾过往,只有少数数据引擎能真正形成规模化飞轮,如谷歌靠全网文本标注形成第一代视觉数据引擎,特斯拉则以车辆采集路况搭建第二代FSD数据闭环。二者共性都是以海量普通用户的真实交互为数据源头。

李士麒把目光投向了另一个群体——全球5亿Makers和1亿活跃3D打印用户。使用比特无限Sparkoh.ai,用户只需要用自然语言描述想法或者画一张简单的草图,系统就能自动生成可打印的物理3D模型。而用户每一次修改、每一次反馈,都会回流到模型中,让下一次生成更加精准。如此,比特无限便能从一个工具,慢慢长成了一个有生命的物理3D数据引擎。

首发| 华为盘古2号位创业做AI生成矢量3D模型,比特无限三个月估值涨10倍

比特无限产品demo视频

一支AI大牛队伍迅速集结。联合创始人周平义,36岁,武汉大学工学博士,是华为盘古大模型初代创始成员、第二代盘古万亿MOE大模型的二号核心研发人员。全球范围内,主导过万亿参数大模型完整训练的人大约只有3000个,其中70%在海外大厂,20%在科研机构,全职创业的堪称凤毛麟角,周平义是其中之一。

首发| 华为盘古2号位创业,三个月估值涨10倍

比特无限联合创始人 周平义

CEO李士麒,多年海外AI To C创业经验,先后打造两款海外百万月活AI工具,深谙欧美创作者社群运营;CTO陈立韬,6年华为仿真与后训练全栈经验,既懂物理约束落地,也懂大模型部署。

创业初期,比特无限几乎处于“水下”状态。周平义博士率队埋头研发全球AI生成矢量3D专用模型,同时低调完成了三轮融资。今年4月,种子轮浮出水面,由清华系卓源亚洲领投,后者曾投资生数科技、基流科技等明星AI项目。随后天使轮和天使+轮相继完成,累计融资4500万元,投资方包括容亿投资、普华资本、壹德资本等机构。

一个值得关注的信号是:容亿投资此前布局了宇树科技、银河通用等具身机器人本体公司;普华资本也投了智平方等具身独角兽。如今,他们不约而同地把目光投向了比特无限——卡位物理3D数据这一关键环节。

逻辑并不复杂。人形机器人赛道已跑出宇树、银河通用这样的头部本体公司,正在爆发的3D打印、工业设计、通用世界模型等市场也在高速扩容,但支撑全行业迭代的标准化物理3D数据基础设施仍显空白。谁能在这个环节卡住位置,谁就有机会成为下一代AI基础设施领域的超级玩家。

这或许是一场新的FOMO。于投资人而言,物理3D数据是通往下一范式的关键拼图,卡位意义不言而喻。正如比特无限从水下浮出,三个月内估值增长十倍。据透露,公司新一轮融资正在进行中,前来对接的投资人明显多了起来。

自研模型全球SOTA

让AI真正理解物理世界

比特无限走了一条不太一样的路。

市面上的3D生成大多是在传统建模软件上叠加AI功能,本质上还是围绕软件命令和人工操作。比特无限从一开始就面向AI-native交互重构了整个设计流程——让AI理解空间几何、结构关系和运动规律,把描述直接转化为可编辑、可制造的物理3D模型

这套逻辑的底层是参数化代码生成模型,天然附带结构信息和可编辑属性,可直接用于3D打印、机器人仿真及Physical AI训练。

落到3D打印场景里,用户用自然语言描述需求,系统自动完成任务拆解、代码生成、执行验证和多轮修正。这恰好对上了创客最真实的需求——他们要的不是“好看的模型”,而是“能用的模型”,如带滑轨的抽屉得能顺畅拉开,每个部件的尺寸和摩擦系数都经得起物理检验。

支撑这一切的是比特无限自研专用物理3D大模型Arko-T。

大多数Text-to-3D模型生成的是形状,40亿参数的Arko-T生成的是可编辑的设计。在Text2CAD-Bench标准评测集上,将Arko-T与7款前沿通用大模型做了12项指标全面对比,有8项排名第一,另有3项指标位列第二,推理成本仅为ChatGPT、DeepSeek等通用大模型的十分之一甚至更低。

首发| 华为盘古2号位创业,三个月估值涨10倍

数据是另一个护城河。周平义介绍,比特无限的训练数据来自两部分:一是自有的千万级端到端数据工程;二是面向全球上亿DIY爱好者的免费建模工具sparkoh.ai,用户每一次修改、调试都会回流到模型中,自动完成后训练优化。

这套闭环的复制门槛不低。成立仅一年,比特无限已经跑通了规模化数据生产的路径。更重要的是,用户增长正在加速。随着Sparkoh.ai在全球Makers社区中的口碑扩散,越来越多的用户开始用自然语言生成可打印模型,每一次使用都在为数据飞轮注入新的动力。

大厂即便不差算力,但要搭建成熟海外创作者运营团队、积累大量活跃用户并非易事。而比特无限已经有了先发优势,正在持续供给真实制造反馈数据。

比特无限自研的Harness Agent调度框架则是打通从创意到实物的最后一环。传统工业建模软件接口老旧、操作割裂,Harness搭建了一个全自动化闭环:拆解用户需求、生成结构化模型、自动校验尺寸和装配问题,不合格自动迭代,全程无需人工介入。

商业化层面,比特无限采取双线并行的策略:C端面向海外Makers的Web Agent采用Token订阅计费模式;B端向工业设计、机器人仿真及Physical AI研发企业开放API接口,客户可按需批量生成符合OpenUSD标准的仿真资产。

一个双向并行且互相反哺的商业化循环逐渐清晰——C端积累的交互数据让模型持续迭代,更强的模型产出更高质量的物理3D数据,反过来供给B端机器人企业。

英伟达、智谱看中了

迎接物理3D「GPT时刻」

成立仅一年,比特无限已经手握几张关键“门票”。

不久前,团队加入英伟达Inception初创加速计划,在智谱官方生态合作伙伴名单中,比特无限也是最年轻的面孔。此外,公司入驻上海模速空间,享有AI算力专项补贴。

首发| 华为盘古2号位创业,三个月估值涨10倍

放眼国内初创圈,同时具备英伟达Inception会员资质、智谱官方生态合作身份、模速空间算力扶持通道的企业并不多见。三方生态资源叠加,能够为团队在算力成本、大模型适配、商业落地渠道上提供切实支持。对于一个创立仅一年的早期团队来说,这些都是实实在在的成本节省和效率提升。

但在李士麒看来,更深远的意义不止于此。这些资源正在将比特无限推向一个更关键的位置,使他们距离生成式物理3D的“GPT时刻”更近了一步。

回望互联网时代,海量文字数据催生了大语言模型。ChatGPT的出现抹平了创作门槛,普通人无需学习复杂的提示词工程,更不必懂得Transformer架构,仅凭自然语言就能自由完成各种文字创作。

如今走进物理AI时代,人类需要海量贴合真实几何与力学规则的三维数据,才能让机器人、智能制造真正落地。但行业正处在一个尴尬的断层里:需求端渴求物理真实的交互数据,供给端AI却只能产出“视觉空壳”。

挑战的另一面是机遇。看清了物理3D数据引擎的长期刚需,李士麒笃信,生成式物理3D赛道很快将迎来它的“GPT时刻”。到那时,无论是3D打印创客,还是工业与机器人领域面临的数据真空,都将被深刻改写。

最直接的是3D打印行业。制造门槛彻底下放,你脑海里闪过的创意,当天就能设计、打印、用上。当然,这将进一步推动3D打印市场走向真正的爆发。

工业产品研发将是效率提升最明显的领域。工程师不再需要耗费大量时间绘制基础零件,AI自动生成带完整装配关系和尺寸约束的方案,研发周期和人力成本都会大幅下降。

“机器人训练的效率,正在被‘建模’这个环节卡住。谁能率先突破,谁就拿到了具身智能时代的入场券。”如周平义所言,当下最热的具身智能与世界模型领域或许是受益最深的。中层仿真资产的供给瓶颈一旦解除,机械臂、人形机器人的虚拟训练素材将不再是稀缺品。通用机器人落地的速度,可能比大多数人预想的更快。

在比特无限内部,抵达这个时刻的时间表已经明确——从当前阶段到生成式物理3D的GPT时刻,窗口期大约18个月。

时钟已经拨动。这家从3D打印数据痛点起步的初创公司,正把每个人的设计、试错、修改,转化为驱动AI进化的养料,试图重构工业制造与具身智能的底层供给体系,一步步搭建起连接数字代码与真实物理世界的底座。

“所想即所得”——这一幕也许此刻听起来遥远,但回头望2022年底ChatGPT刚出来的时候,谁又能想到两年后的大模型江湖会变成今天这个样子。此时此刻,已是拐点前夜。

文章来自于微信公众号 “投资界”,作者 “投资界”

首发| 华为盘古2号位创业做AI生成矢量3D模型,比特无限三个月估值涨10倍最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
https://www.qske.com/news/%e9%a6%96%e5%8f%91-%e5%8d%8e%e4%b8%ba%e7%9b%98%e5%8f%a42%e5%8f%b7%e4%bd%8d%e5%88%9b%e4%b8%9a%e5%81%9aai%e7%94%9f%e6%88%90%e7%9f%a2%e9%87%8f3d%e6%a8%a1%e5%9e%8b%ef%bc%8c%e6%af%94%e7%89%b9%e6%97%a0/feed/ 0
为什么AI对就业的冲击没有体现在失业率上? https://www.qske.com/news/%e4%b8%ba%e4%bb%80%e4%b9%88ai%e5%af%b9%e5%b0%b1%e4%b8%9a%e7%9a%84%e5%86%b2%e5%87%bb%e6%b2%a1%e6%9c%89%e4%bd%93%e7%8e%b0%e5%9c%a8%e5%a4%b1%e4%b8%9a%e7%8e%87%e4%b8%8a%ef%bc%9f/ https://www.qske.com/news/%e4%b8%ba%e4%bb%80%e4%b9%88ai%e5%af%b9%e5%b0%b1%e4%b8%9a%e7%9a%84%e5%86%b2%e5%87%bb%e6%b2%a1%e6%9c%89%e4%bd%93%e7%8e%b0%e5%9c%a8%e5%a4%b1%e4%b8%9a%e7%8e%87%e4%b8%8a%ef%bc%9f/#respond Fri, 24 Jul 2026 07:56:00 +0000 https://www.qske.com/news/%e4%b8%ba%e4%bb%80%e4%b9%88ai%e5%af%b9%e5%b0%b1%e4%b8%9a%e7%9a%84%e5%86%b2%e5%87%bb%e6%b2%a1%e6%9c%89%e4%bd%93%e7%8e%b0%e5%9c%a8%e5%a4%b1%e4%b8%9a%e7%8e%87%e4%b8%8a%ef%bc%9f/ 都说AI抢工作,但一个显而易见的疑问是—— 失业率的数据为神马动静不大? 没错,一边我们看到AI能力在狂飙,但另一边就业市场似乎比较平静。 我现在很多工作的确交给Claude Code和WorkBud

为什么AI对就业的冲击没有体现在失业率上?最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
都说AI抢工作,但一个显而易见的疑问是——

失业率的数据为神马动静不大?

没错,一边我们看到AI能力在狂飙,但另一边就业市场似乎比较平静。

我现在很多工作的确交给Claude Code和WorkBuddy,但我经常去的西北旺万象汇咖啡店贴的招聘启事,和之前相比,貌似没有神马变化。

这其中肯定有某些被我们忽视了的东西。

值得用数据深入分析。

最近我把今年上半年发布的一批劳动经济学论文盘了盘。

这里边有覆盖美国全国的招聘数据,也有Upwork的两百多万份成交合同,以及标普500十年的年报。

发现了一些有意思的结论——

简单地说,就业冲击早就开始了,只是它绕开了失业率,先动了招聘岗位的内容和劳动力市场的定价规则。

没错,等到能在新闻里看见冲击的那天,那留给你我调整的时间可能已经不多了。

下面咱们就挑3篇论文一起来看一看,从数据的角度,劳动经济学家如何理解AI就业冲击。

三篇论文的叙述都蛮克制滴,全程数据说话,但这种克制也让我对AI的就业冲击有了更直观的理解。

先看第一篇论文:《Generative AI and the Reorganization of Labor Demand》,来自普渡大学,它就研究一个问题:AI如何影响招聘?

为什么AI对就业的冲击没有体现在失业率上?

简单地说,公司调整用人有三板斧——裁员、减少新招聘、调岗位职责。

裁员动静最大,它是要上热搜滴,CEO还得配一封假惺惺的公开信,各项成本都很高,能不用就不用。

少招人就要容易得多,HR在预算表里改个数字就行。

改岗位最隐蔽,公众不知道,公司内部也静悄悄的。

而失业率的宏观数据要等这些动作层层传导后才会有所体现。

那问题来了——上面这三个方式怎么样才能从数据的角度非常清楚的研究它们呢?

答案是招聘启事。

JD(职位描述)是骗不了人的,它每一行任务都对应一笔要支付的工资,辣是企业的心里话。

比如同样叫产品经理的岗位,今年的职位描述和两年前相比,悄悄变了。

比如,过去写着负责数据清洗的地方,现在可能改成了负责AI工具输出结果的验证和优化。

岗位名字没变,里面的任务被悄悄替换了。

这就是温水煮青蛙。

普渡大学的Fangyan Wang、Zaiyan Wei和Yang Wang三位学者量化了这件事。

他们从Lightcast拿到了美国全行业招聘数据,原始量1.88亿条,按职业乘行业乘职级切成25349个格子,每个格子里随机抽5%,最终处理了937万条。

然后用两级大模型流水线逐条拆解——

第一阶段用Llama-3.1-8b从每条JD里抽出3到10条具体任务;(抽取任务用开源的模型是为了省成本。)

第二阶段用GPT-5-nano给每条任务标注AI替代等级(论文里叫AI暴露度)——

E0完全没戏,E1一个现成AI就能省一半时间,E2 AI几乎能完全做到。(这里没有使用最强的模型,主要是因为数据量太大,成本难以承受,毕竟937万条。)

为什么AI对就业的冲击没有体现在失业率上?

为什么AI对就业的冲击没有体现在失业率上?

(在公众号“卫夕指北”回复关键词“招聘”获取论文原文)

经过这一轮分析之后,数据出来了——

全美所有岗位的平均AI可替代率是:0.396。

分层来看,48.9%的任务AI帮不上忙,28.2%一个现成工具直接就能省一半时间,22.9%AI几乎能完全做到

简单地说,美国企业写在JD里的任务,接近一半已经在AI的射程之内。

具体到职业,最易被替代的前几名挺有意思:词作者和创意写作者高居榜首,AI可替代率高达0.839。(我瑟瑟发抖中)

后面跟着作家、技术写作、Web开发、搜索营销策略师、编辑。

文字工作者集体上榜,说明基础的写作在AI面前几乎裸奔。

而最不会被替代的是:打桩机操作员、飞机货运督导、铁轨信号维修工,AI可替代率在0.05附近。

看来,至少从这份数据看,物理世界暂时还是人类的地盘。

为什么AI对就业的冲击没有体现在失业率上?

分行业AI可替代率热力图,金融保险0.584排第一,住宿餐饮0.239垫底

行业差异也非常大——

金融保险0.584高居第一,专业科技服务0.548第二,信息业0.545第三。

最低的三个是住宿餐饮0.239、零售0.289、运输仓储0.292。

这么看,白领和蓝领区别还是蛮大滴,所以,作为我这个号的读者,千万不要有神马优越感。

一个反直觉的发现是:高级岗位的AI可替代率0.595,比初级的0.435和中级的0.388都要高。

然后论文分析了整体AI可替代率的时间走势——

为什么AI对就业的冲击没有体现在失业率上?

AI可替代率季度走势

从2022年初到2023年底,全美招聘启事的AI可替代率从0.415降到了0.378。

ChatGPT发布之后,企业JD里的AI可替代任务含量反而变少了。

难道不是牛逼的AI来了更多的工作更容易被替代吗?

这又是为神马呢?

原因在于——企业正在有意识地把AI能干的活从岗位描述里拿走。

不是AI不行了,是公司不打算让人来做那些事了。

有人会说这几年美联储加息,金融信息这些高暴露行业本来就在收缩,测到的会不会只是宏观周期?

作者把分解限制在每个行业内部重新跑了一遍,把跨行业挪动整个剔除,结论还是一样滴。

所以,宏观周期不背这口锅。

论文并没有停留在这里,它一个极其精彩的分析就是:这个AI 替代率下降的趋势到底是怎么造成的?

作者团队用Kitagawa三重分解的方法把下降拆开来看。

用食堂打比方就容易理解:

食堂人均菜价降了,可能是菜单换了贵菜下架便宜菜上架(构成效应),也可能是每道菜自己降价了(组内效应),还可能二者的叠加效应。

为什么AI对就业的冲击没有体现在失业率上?

三重分解——2023年Q3起构成效应与组内效应双双转负

2023年三季度是分水岭,从这个季度起,换掉招聘岗位占52%,岗位不变重新设计任务

占39.5%,二者叠加发生占8.5%。

不裁员,但悄悄地改变岗位描述和职责贡献了整个调整的四成,论文特别指出这个占比还在逐季走高。

按职级拆开看的发现——

为什么AI对就业的冲击没有体现在失业率上?

高级岗位——构成效应主导(70.80%),2022年Q2就转负

高级岗位2023年Q3后换掉招聘岗位占到70.80%,岗位不变重新设计任务只占24.01%。

说明对高级岗位,公司直接改招聘结构,少发某些类型的高级职位,岗位内容本身动得不多。

也就是说,高级岗位要么就是不招这个岗位了,但你一旦招,你该干啥还是干啥。

为什么AI对就业的冲击没有体现在失业率上?

初级岗位——重新分配、重设计与叠加三力齐发

但初级岗位是三管齐下——

换掉招聘岗位60.15%、岗位不变重新设计任务18.22%、二者叠加达21.63%。

这意味着,对于适合年轻人的初级岗位,公司一边挑着招、一边改任务,两件事同时发生。

管理学里有一个概念叫组织社会化:新人通过观察、模仿和试错,逐步理解组织如何运行。

过去初级岗位的隐性合同是:拿低薪,换练手的机会。

现在练手的那部分活儿恰恰是AI最先接走的。

所以,我们看到的裁员并不多,也看不到失业的热搜,但年轻人的练手入门的机会在慢慢关闭。

这个研究数据真实而有说服力,应该引起大多数人的重视。

有人会说,初级岗位受冲击,那我十年经验总能保住溢价吧?

额,可能和你想的不一样。

我们来看另一篇论文——《Human Capital, AI, and Labor Commoditization》

为什么AI对就业的冲击没有体现在失业率上?

作者是UCLA安德森商学院的Siddiq和Zhang,他们在2026年3月分析了自由工作者接单平台Upwork20.2万个工作者档案。

论文共筛出49610名从2021年Q1到2026年Q1连续在场的工作者,背后是226万份真实成交合同。

样本覆盖12个大类102个子类目,他们用向量模型把每个工作者档案压成384维向量。

然后把客户看到的信息分成四类——自我展示、资历、口碑、价格。

接下来单独训练一个需求预测模型,专门用来预测:

这个人这个季度的预期订单里,有多少归功于自我展示,多少归功于资历,多少归功于口碑,多少归功于价格。

为什么AI对就业的冲击没有体现在失业率上?

四条曲线——三类人力资本信号走低,价格信号走高

(在公众号“卫夕指北”回复关键词“价格”获取论文原文)

结果蛮残酷滴——

ChatGPT发布后,在AI高替代率的类目里,自我展示、资历、口碑三类人力资本信号对需求的解释力全部显著下降,双重差分系数分别是-0.029、-0.024、-0.029。

而同一时期,价格的解释力显著上升,系数+0.011。

三条往下,一条往上。

也就是说,AI来了,客户不看你是谁了,客户开始看你要多少钱。

到样本最后四个季度,三个降幅扩大到-0.039、-0.033、-0.035,价格升幅扩大到+0.018。

也就是说,你的资历慢慢失效这个趋势还在加速。

为什么AI对就业的冲击没有体现在失业率上?

三重差分——人力资本溢价压缩与订单流向低价者同时发生

具体而言,订单从贵的人流向了便宜的人,需求向低价组转移了7.9%。

经济学上这叫劳动商品化。

买家不在乎谁生产的,只在乎价格。

也就是说,当客户认为AI会交付的结果趋于同质,然后他就会减少研究你是谁,把注意力转向你收多少钱。

经济学家阿克洛夫1970年著名的柠檬市场论文说的就是这个:

买方难以识别质量差异,高质量供给的定价会被低质量供给拖下来。

AI进一步抬高了识别难度,因为每个人都能快速交出一份看起来挺专业的产出,新手借助AI交出的活儿和老手的差距肉眼难辨。

当产出趋同,买家自然不再为卖方的履历付溢价。

在我看来,自由职业市场没有制度缓冲,所以这个资历失效的现象先表现了出来。

而普通白领工作,这个趋势并不是木有,大概率只是滞后发生了。

该来的,还是会来。

接下来的一个问题是:为什么自己和自己身边的人受到的冲击好像没有辣么明显?

下面这篇名为《AI Adoption in S&P 500 Firms》的论文给了一个答案:真正深度采用AI的企业数量,远木有社交媒体营造的辣么夸张。

为什么AI对就业的冲击没有体现在失业率上?

MIT团队联合卡内基梅隆的研究者想到了一个企业不敢吹牛的地方:SEC的10-K年报。

美国证券法禁止上市公司在年报里做重大虚假陈述,这个文件里写错了是要吃官司滴。

发布会可以吹,PR稿可以吹,但年报里乱吹的法律成本高很多。

他们把标普500公司2016到2025年整整十年的年报都收集起来,用AI给每家公司每年打了一个1到5分的AI采用分。

1分,完全不提AI或只是零星提及;

2分,在探索AI能力但没证据显示进了产品或运营;

3分,AI已整合进流程但还没带来财务影响;

4分,生产级部署,且有了成本节约或收入贡献;

5分,AI是公司核心组件,深度嵌入业务。

为了验证数据的准确性,研究人员也手工抽样对数据进行了复核。

复核发现2023年起,七巨头清一色5分,唯一例外是苹果,和市场对它AI掉队的普遍观感严丝合缝。(苹果在AI方面真是烂泥扶不上墙)

而且也做了交叉验证,发现他们用这种方法做出的数据和Ramp公司基于五万多家企业刷卡交易测出的AI付费率对比,2025年相关系数高达0.87。

所以,这个数据是严谨靠谱滴。

基于这个前提,我们来看一下这些年报呈现出来的数据到底呈现什么样的规律——

为什么AI对就业的冲击没有体现在失业率上?

标普500公司AI采用等级十年演化——2023年是拐点,但到2025年仅21%过深水线

2025年,5分公司(AI深度嵌入战略和财务核心)占11%,4分(生产级部署)再加10%,合计21%过了深水线。

2022年只有5%,三年翻了四倍。

但这个数据也意味着将近八成的美国头部上市公司,到2025年还没让AI真正进入生产。

而深度整合的公司里三分之二来自科技板块。

消费必需品、食品饮料有四分之一年报对AI只字不提。

所以,结论就很明确了:

所谓企业AI革命,到2025年为止基本上还是科技行业的内部革命,并木有大规模扩散。

我们继续看数据呈现的三个特征——

第一,标普500的采用率从5%飙到21%只用了三年,如果速度保持,2028年前后过半企业跨过深水线。

第二,科技行业里,完全没碰AI的公司平均净利率14.4%;试点整合阶段反而跌到12.4%;深度整合后回升到17.4%,基本上是一条U型曲线。

搞AI,先亏后赚的路径被证实了。

为什么AI对就业的冲击没有体现在失业率上?

U曲线——试点期利润先跌到12.4%,深度整合后回升到17.4%

第三,七巨头的资本开支在2026年奇高——谷歌预计1750亿到1850亿(最近财报又大幅增加了)、Meta预计1150亿到1350亿、亚马逊放话约2000亿,这些基建完成后AI的能力和渗透率会再上一个台阶。

保罗·戴维研究电气化历史时就发现,工厂把蒸汽机换成电动机并不会自动获得巨大生产率。

真正的收益需要重建厂房布局、生产流程和管理方式。

AI逻辑也是一样滴。

同样需要一整套补充资产:流程接口、法律边界、员工培训等一大堆需要操心滴。

一旦先行者证明了利润可以回来,后面的跟随者会加速涌入。

到那个时候,目前只在科技行业发生的招聘重组和资历失效,将蔓延到大部分行业。

也就是说,现在感觉不到冲击的人,只是因为冲击波还没到你所在的行业。

说两个不那么舒服的建议——

第一,不要再岗位名称描述自己了。

拿一张纸,列出过去两周完成的全部任务,给每项标一个分数:AI当前能替代多少,超过四成就该警觉了。

你的目标应该很直接:二个月到半年时间,让这类任务占比降到30%以下。

第二,争取组织影响力。

你只能接任务,AI毫无疑问会和你竞争,但如果你TM可以定义任务和验收任务,AI就可能成为杠杆。

从综合上边三篇论文来看,尽管AI 对不同行业产生冲击的时间表存在差异,但总体而言:时间不多了。

做好准备吧,乱纪元要开始了。

《肖申克的救赎》里有句话很多人熟悉:Get busy living, or get busy dying。

所以,你在忙什么?

作者简介:卫夕,公众号“卫夕指北”出品人,科技专栏作者,专写长文,专写不一样的,专注剖析AI、广告及互联网的底层逻辑;不关注这个账号,你都不知道你会错过神马!

文章来自于微信公众号 “卫夕指北”,作者 “卫夕指北”

为什么AI对就业的冲击没有体现在失业率上?最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
https://www.qske.com/news/%e4%b8%ba%e4%bb%80%e4%b9%88ai%e5%af%b9%e5%b0%b1%e4%b8%9a%e7%9a%84%e5%86%b2%e5%87%bb%e6%b2%a1%e6%9c%89%e4%bd%93%e7%8e%b0%e5%9c%a8%e5%a4%b1%e4%b8%9a%e7%8e%87%e4%b8%8a%ef%bc%9f/feed/ 0
刚刚,Claude爆改语音!11种语言,就是没中文 https://www.qske.com/news/%e5%88%9a%e5%88%9a%ef%bc%8cclaude%e7%88%86%e6%94%b9%e8%af%ad%e9%9f%b3%ef%bc%8111%e7%a7%8d%e8%af%ad%e8%a8%80%ef%bc%8c%e5%b0%b1%e6%98%af%e6%b2%a1%e4%b8%ad%e6%96%87-2/ https://www.qske.com/news/%e5%88%9a%e5%88%9a%ef%bc%8cclaude%e7%88%86%e6%94%b9%e8%af%ad%e9%9f%b3%ef%bc%8111%e7%a7%8d%e8%af%ad%e8%a8%80%ef%bc%8c%e5%b0%b1%e6%98%af%e6%b2%a1%e4%b8%ad%e6%96%87-2/#respond Fri, 24 Jul 2026 07:55:00 +0000 https://www.qske.com/news/%e5%88%9a%e5%88%9a%ef%bc%8cclaude%e7%88%86%e6%94%b9%e8%af%ad%e9%9f%b3%ef%bc%8111%e7%a7%8d%e8%af%ad%e8%a8%80%ef%bc%8c%e5%b0%b1%e6%98%af%e6%b2%a1%e4%b8%ad%e6%96%87-2/ 刚刚,Anthropic和OpenAI同时放出了语音模式大升级!Claude这边,从只能跑Haiku升级到Opus 4.8和Sonnet 5全系列,不仅能在对话里调Gmail、日历、Slack,还扩增到11种语言,但没有中文。

刚刚,Claude爆改语音!11种语言,就是没中文最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
刚刚,Anthropic和OpenAI同时放出了语音模式大升级!

Claude这边,从只能跑Haiku升级到Opus 4.8和Sonnet 5全系列,不仅能在对话里调Gmail、日历、Slack,还扩增到11种语言,但没有中文。

刚刚,Claude爆改语音!11种语言,就是没中文

OpenAI那边,全双工GPT-Live直接搬上了macOS和Windows桌面,动动嘴就同时指挥一整队Agent,并且支持中文。

刚刚,Claude爆改语音!11种语言,就是没中文

Claude Voice大升级

在此之前,Claude的语音模式只能跑Haiku,也就是最小的那个模型。

你跟它语音聊天,它能听懂,但稍微复杂一点的问题就容易翻车。

现在,Opus 4.8和Sonnet 5都上了。

你可以在对话中途切换模型。系统自动调用所选模型的最快版本。注意,是最快版本,不是完整推理版本。

刚刚,Claude爆改语音!11种语言,就是没中文

好消息是,语音模式会默认加载你上次文字聊天用的模型,文字和语音之间上下文不断,无缝来回切。

交互方面,则有两种模式:Hands-free持续监听自动回复,Push-to-talk按住说话松手结束。

当然,要说最重要的,那还得是「工具调用」。

语音对话中,Claude现在可以直接连接你的Gmail、Google Calendar、Slack、Google Docs、Canva

说一句话,它替你翻邮件、查日历、读文档、发消息。

Anthropic的产品经理Robert Bye举了几个例子:

· 帮我总结Slack过去几小时我错过了什么。

· 把新项目PRD的摘要发给Slack上的Nick。

嘴上说完,活就干了。

刚刚,Claude爆改语音!11种语言,就是没中文

技术上,语音里的工具调用和文字聊天走的是同一套Connectors架构,不是阉割版,每次调用前还会先问你要许可。

所有套餐都能用,但免费用户只有Haiku加1个连接器,Opus全套得氪金。用量从常规额度里扣,今天起全平台公测推送。

11种语言,没有中文

语言方面,Claude语音模式这次支持了11种语言:英语、法语、德语、印地语、印尼语、意大利语、日语、韩语、巴西葡萄牙语、拉美西班牙语、欧洲西班牙语。

从头找到尾看一遍,没有中文。

对这部分用户来说,还是得继续打字。

刚刚,Claude爆改语音!11种语言,就是没中文

而且Claude不会自动检测你说的是什么语言

你得主动开口让它切,比如「请用日语跟我说话」,或者去设置里手动选。不切的话,默认是英语。

有意思的是,此前有开发者从Claude App的代码中扒出过一份语言列表,包含18种语言,其中明确写着Chinese

结果,18种变11种,中文直接被砍了。

刚刚,Claude爆改语音!11种语言,就是没中文

ChatGPT Voice杀入桌面

相比之下,ChatGPT的语音则是从底层换了一套全新的架构

它用的是7月8日刚发布的GPT-Live,一个全双工语音模型。

所谓全双工就是,模型能够同时处理输入和输出音频流,并且每秒做出几十次判断,不用等你说完就能回应

所以GPT-Live会在你说话中间「嗯嗯」「明白了」,像活人在听。

更进一步来看,它基于的是一个双层架构

前台是一个轻量低延迟的语音模型,负责实时对话、轮次管理、打断响应,所有需要毫秒级反应的事。

后台是GPT-5.5,负责复杂推理、网页搜索、Agent任务。

当你问一个需要深度思考的问题,GPT-Live会把任务异步委派给后台的GPT-5.5,然后自己继续跟你聊,等结果出来了再汇报。

OpenAI管这个叫「委派推理」(Delegated Reasoning)

刚刚,Claude爆改语音!11种语言,就是没中文

具体来说就是,OpenAI把对话延迟和推理深度,被彻底解耦了。你不需要等大模型想完才能继续说话。

推理深度还能调三档:Instant最快,Medium中等推理,High深度推理,分别对应GPT-5.5的不同档位。免费用户用的是GPT-Live-1 mini

从跑分来看,这个委派架构是真的管用,语音模式终于不再是「降级版聊天」了。

  • GPQA(专家级科学推理)从此前高级语音模式的45.3%跳到84.2%
  • BrowseComp(Agent网页搜索能力)从0.7%飙到75.2%
  • 模拟真实多轮电信客服场景的τ³-Voice Telecom基准,GPT-Live也全面碾压。

刚刚,Claude爆改语音!11种语言,就是没中文

刚刚,Claude爆改语音!11种语言,就是没中文

刚刚,Claude爆改语音!11种语言,就是没中文

嘴上说着,多个Agent同时跑

有了这套底子,OpenAI直接把它搬上了桌面。

从今天起,ChatGPT Voice正式登陆macOS和Windows桌面端。

你可以设一个全局快捷键,在任何应用里一键唤起ChatGPT Voice。

macOS上还有Appshots功能,ChatGPT可以直接读取你当前活跃窗口的内容,作为对话的上下文。

比如,对着Excel说「帮我算一下Q3同比」时,它能看得到你的表格。

刚刚,Claude爆改语音!11种语言,就是没中文

此外,你还可以用语音指挥ChatGPT Work和Codex里的多个Agent同时工作

一边让一个Agent写代码,一边让另一个Agent查文档,嘴上说着就行。

GPT-Live在前台跟你说话,后台同时启动、检查、切换多个工作线程,不需要你回到键盘前。

目前,Plus、Pro、Business、Edu、Enterprise套餐可用。

10秒钟就能感受到的差距

  • 能不能打断

Claude语音是轮流制,你说完它才想。想插嘴?等着。

GPT-Live可以被打断。你说到一半改主意了,它立刻停下来跟上你新的想法。打断前说到哪儿,它还记得。

  • 能不能一心多用

Claude一次只做一件事——语音聊天。

ChatGPT Voice在桌面端可以一边跟你说话,一边在后台操控电脑、指挥多个Agent各干各的。

「帮我开个PR,同时查一下昨天的CI日志」,两件事可以同时开始跑。

  • 能不能动手

Claude语音可以通过连接器调用Gmail、日历这些SaaS工具,但它摸不到你的桌面

ChatGPT Voice在桌面端配合Computer Use,可以直接操控你的电脑。文件、程序、终端,它都能碰。

  • 想得有多深

Claude的底牌是Opus 4.8,在多步推理和知识综合类任务上依然是最强模型之一。但语音模式跑的是Opus的最快版本,不是满血推理版。

GPT-Live这边,High档可以异步委派给GPT-5.5 Thinking做深度推理,反而能在语音场景下调用接近满血的推理能力。

刚刚,Claude爆改语音!11种语言,就是没中文

连输入框都不需要的时代

看到这儿,两家的分岔就清楚了。

轮流制的Claude,主打的是用你自己的Gmail、日历、文档,帮你把自己那摊事理明白。

全双工的GPT-Live,主打的是像在跟一个人说话。可打断、可多线程、可操控电脑,让你忘记对面是AI。

对不写代码的人来说,Claude门槛低得多,有邮件要理、日程要排,张嘴就行。

OpenAI那条路更爽也更极客,你手里得先真有一队Agent、有真活给它们干。

正如Greg Brockman所说,「比起语音,打字这件事本来就特别不自然。」

那把陪了人类四十年的塑料按键,如今正式被OpenAI和Anthropic同时逼到了墙角。

刚刚,Claude爆改语音!11种语言,就是没中文

参考资料:

https://x.com/testingcatalog/status/2080401533728940372

https://x.com/OpenAI/status/2080378182469857576

https://x.com/testingcatalog/status/2080385285951521150

https://x.com/claudeai/status/2080376094939603366

https://claude.com/blog/think-through-hard-problems-in-voice-mode

文章来自于微信公众号 “新智元”,作者 “新智元”

刚刚,Claude爆改语音!11种语言,就是没中文最先出现在智融AI—汇聚万千人工智能应用和企业,找应用、找需求、找供应商,就上智融AI产业综合平台

]]>
https://www.qske.com/news/%e5%88%9a%e5%88%9a%ef%bc%8cclaude%e7%88%86%e6%94%b9%e8%af%ad%e9%9f%b3%ef%bc%8111%e7%a7%8d%e8%af%ad%e8%a8%80%ef%bc%8c%e5%b0%b1%e6%98%af%e6%b2%a1%e4%b8%ad%e6%96%87-2/feed/ 0