还珠格格
ZPedia|Qwen 3.8 Max Preview实测:逼近顶级闭源上限,长任务稳定性略输K3_我的网站

一 | 需要说明的是,这并不是科学记者的夸张之词。

二 | 7 月 19 日,Qwen 团队毫无预热地抛出了一枚重磅炸弹:Qwen 3.8 即将发布,并将开放权重。天文学家称这些系统为灾难性变星是一个恰当的描述。 按照官方披露的信息,这一代模型的总参数规模达到 2.4 万亿。这个术语描述了一个白矮星和一个次级“正常”恒星的配对,前者是一颗曾经强大的恒星的密集残余物,后者跟太阳类似但质量可能较小。更引人注目的是 Qwen 对它的定位:与一线闭源旗舰正面竞争,并声称其能力「仅次于 Fable 5」。与此同时,Qwen3.8-Max-Preview 已经先一步进入 Token Plan、Qoder 和 QoderWork,开发者不必等待完整权重发布,就可以提前试用。在这对组合的紧密轨道上,白矮星由于其极端的引力而从较大的恒星上吸走恒星物质。

三 | 周三发表在《自然》上的新灾难性变量的发现其特点是一颗大小为太阳1/100的白矮星和一颗更大的恒星--约是太阳质量的10%并挤在一个木星大小的球体中。

四 | 这对恒星距离地球约3000光年,其被标记为ZTF J1813+4251。

五 | 这是一份相当激进的宣言。

六 | 它是在兹威基瞬变设施拍摄的图像中被发现,这是一项广域调查,其使用加州帕洛玛天文台的一台望远镜并依次拍摄数百张天空图像。

七 | 过去一年,前沿模型的竞争已经从谁的榜单分数更高,转向了更复杂的综合较量:模型能否稳定调用工具,能否理解真实网页和复杂状态,能否在长任务中保持约束,能否直接交付可运行的软件和媒体文件。单看参数规模,已经很难判断一个模型真正能做什么。 所以,我们没有打算复述发布文案,也不准备只用几道数学题替它排座次。兹威克瞬变设施目录使天文学家能寻找恒星亮度的快速变化。这篇文章要回答的是一个更朴素的问题:Qwen 3.8 Max Preview 现在究竟能不能完成真实、复杂、可验收的工作? 在进入实测之前,先把这次发布中已经确认的事实、仍待验证的承诺,以及 2.4 万亿参数背后的实际意义拆开来看。 先把事实和口号分开 先把事实和口号分开。 截至目前,Qwen官方确认的核心信息并不算多:2.4T总参数规模;`qwen3.8-max-preview`已进入Token Plan、Qoder与QoderWork;后续将开放权重,但发布日期、许可证和最低部署要求均未公布;官方将提升方向概括为Coding与Cowork,覆盖全栈开发、数据分析和Office工作流等复杂长程任务。

八 | 这足以说明,Qwen 3.8是一款规模极大、推理预算极高、面向Agent场景设计的模型。

九 | 这就是研究人员发现这对奇特的星体的方式。但Qwen尚未公开完整模型卡、技术报告或统一评测表。“这是一个特殊的系统,”麻省理工学院的天体物理学家Kevin Burdge说道。 为了穿透宣传滤镜,我们选择用测试 K3 的同一套题目来检验它。他指出,这是已知的行为最优美的灾难性变数之一。

十 | Burdge和他的同事们搜索了茨威基的数据以试图在深黑的太空中找到灯塔。逻辑非常简单:两者参数规模接近,且都将自己定位为顶级闭源模型的挑战者。 在此前对 K3 的评测中,我们设计了一套覆盖复杂软件工程、长程工具调用、多模态状态理解和最终产物交付的测试集。他们希望看到有规律的眨眼特征--Burdge通常在寻找快速的眨眼,这是因为它们往往是一对恒星快速运行的信号。研究小组看到ZTF J1813+4251每51分钟闪烁一次。现在,同一套题目被原封不动地搬到了 Qwen 3.8 面前,约束条件、任务边界和评判标准完全一致。据悉,这是其中一颗恒星从另一颗恒星前面经过并使其光线变暗。 Qwen 3.8 能否在统一条件下稳定完成复杂软件工程任务?能否在长时间工具调用后依然死守最初的约束?能否准确理解网页、截图、表格和文件之间的状态演变?又能否最终交付一个真正可以跑通、打开和检查的实体产物?这些问题的答案,远比再看一份厂商自测榜单更有价值。

十一 | 实测Qwen 3.8 (一)复杂 UI 的视觉解析与代码重构 重建结果 第一题看起来像一道常规的前端题,实际上同时考察了视觉识别、页面拆解和工程交付。闪烁的时间跟迄今为止发现的灾难性变星的最短轨道相吻合。 我们向模型上传了一张 2000 × 1091 的 NASA Webb Images 页面截图,只发送了一句话: 你是一个资深的前端开发工程师。请仔细观察这张科普网站的截图,并将其转化为单文件的 HTML 代码。

十二 | 没有告诉它页面名称,没有提供素材地址,也没有补充技术栈、响应式或“像素级复刻”之类的要求。通过用夏威夷和西班牙的其他望远镜以及天基望远镜进行观测,这使得研究人员对恒星变得更加集中,并能更准确地测量它发出的光线。不过这引发了一个难题。Burdge在一份新闻稿中指出:“有一颗恒星看起来像太阳,但是太阳无法进入一个短于8小时的轨道。模型必须自行识别截图中的信息层级,并决定如何在一个 HTML 文件里重新实现。

十三 |
Qwen 3.8 Max Preview 顺利交付了一个可以直接打开的 index.html。页面不是把原截图塞进 里冒充复现,而是使用独立的 HTML、CSS、SVG 和 Canvas 重新搭建。”太阳的质量使它无法拥有如此紧密的轨道。
从结果来看,它准确识别出了 NASA 页面最关键的四层结构:顶部黑色全局导航、深灰色 Webb 二级导航、左文右栏的主体内容,以及底部横向天文图像。

十四 | 那么为什么这颗木星大小的恒星会这样做呢?Burdge和研究小组已经确定的解释是,这颗白矮星一直在吞噬其伙伴星的一大块氢。这留下了一个更密集的氦气核心,而这有助于稳定紧密的轨道。Webb Images 标题、整段介绍文字、两组共八个图片分类也全部保留,没有出现常见的错字、改写或凭空编造。简而言之,研究小组是在这一过程的中间阶段观察这对恒星的,当时白矮星已经剥去了大部分的氢。 尤其是双层导航,模型不仅识别出了Explore、搜索框、NASA 标志、News & Events、Multimedia 和NASA+ LIVE,也完整还原了第二层的 Webb、News、Overview、Science、Observatory、Multimedia、Team 和 More。剥离后的白矮星留下了一个吸积盘,它像土星环一样围绕着核心。对一项只有截图输入的任务而言,这说明它的视觉文字提取和页面语义拆分都很稳。“这是一个罕见的案例,我们在从氢到氦的吸积过程中抓住了其中的一个系统,”Burdge说道。 页面中的 NASA 标志没有调用外部图片,而是用 SVG 重新绘制;底部天文图也没有依赖网络资源,而是用 Canvas 生成星空、星系核心和散落星体。

十五 | 在12亿颗恒星中,该算法挑出了我们迄今发现的最有趣的灾难性变数之一。

十六 | 这个选择让文件在断网环境下仍然能够完整显示,也说明模型确实理解了“单文件交付”的工程含义。

十七 | 但它还没有达到像素级视觉复刻。模型知道页面由什么组成,却没有准确估计这些元素在目标分辨率中的绝对尺度;它完成了最显眼的桌面首屏,却没有继续检查窄屏和可访问性。这一幸运的发现有助于支持早先提出的关于大灾变体过渡到超短轨道的理论,该理论是在近四十年前提出的--现在我们知道这确实发生了。

十八 | 这使 Case 1 的结论非常明确:Qwen 3.8 Max Preview 已经具备扎实的视觉到代码能力,第一版就能做到八成完成度,但距离闭源旗舰所追求的精细设计还原与产品级收尾,仍有一段肉眼可见的距离。 (二)复杂业务逻辑与动态数据可视化计算 我们给模型提供了 28 条多模型 API 运行记录、一份 AstraOps 品牌规范和一个 SVG 标志,要求它实现一个单文件、完全离线的运营驾驶舱。题目不只要求页面好看,还明确规定了五项核心指标的统计口径、四类数据图表、三级筛选联动、异常检测规则、明细表排序和成本情景模拟器。 Qwen 3.8 Max Preview 最终交付了一个 1203 行的单文件 HTML。所有数据、样式、SVG 图表和交互逻辑都内嵌在文件中,没有使用 React、第三方图表库、CDN 或网络请求。 我们直接调用其内嵌计算逻辑对原始数据进行校验,默认视图的五项结果与标准答案完全一致。该小组还进行了模拟以确定ZTF J1813+4251的最终命运。 页面完整实现了题目要求的四类图表:每日模型请求量使用堆叠柱状图,成功率使用多折线图并绘制 97% 警戒线,成本—质量关系使用气泡散点图,请求量占比则使用环形图。 这些图表全部由原生 SVG 生成。柱体、折线节点、气泡和环形扇区都来自当前筛选后的数据,并提供模型颜色、坐标、数值标签和悬停提示。他们预测,在约7000万年后,这对天体将更快地围绕对方运行,每18分钟做一次完整的循环。尽管人们不会看到它,但一旦激光干涉仪空间天线(LISA)在2030年代末的某个时候进入轨道,那么研究人员将能更详细地研究这个灾难性的变量。散点图中的横坐标确实按“总成本 ÷ 总请求量 × 1000”计算,纵坐标则是请求量加权质量分,气泡半径与请求量关联;并不是在一个固定坐标上摆四个装饰圆点。 Case 2 是 Qwen 3.8 Max Preview 第一次真正让人感到超出预期的地方。

十九 | 这一系列卫星将被用来探测引力波--这些恒星舞伴将产生引力波。

| 面对一份带有明确业务口径的结构化需求,它没有把主要精力浪费在华丽装饰上,而是先建立统一的数据状态,再让指标、图表、异常和模拟器共同消费这份状态。除了时间筛选窗口的一个边界问题,首轮交付已经接近可以进入代码评审的内部工具原型。 (三)复杂规则驱动的建筑疏散仿真 第三题把难度再次提高。 这一次,模型需要根据一个 24 × 16 的建筑网格和一份仿真规则,构建包含 12 名人员、4 扇防火门、2 个出口和 1 个烟雾源的交互式疏散沙盘。人员速度不同,出口容量不同,烟雾会按固定周期扩散,D4 会在 12 秒时自动关闭。系统还必须处理寻路、碰撞等待、出口排队、烟雾暴露、受困与恢复路径。

| 这类题非常适合识别模型是否在演戏。

| 一个页面可以用 CSS 动画让小圆点看起来在移动,也可以预先写死 12 条轨迹,但只要用户提前关门或切换播放速度,伪仿真就会立刻露馅。 Qwen 3.8 Max Preview 交付的是一个 724 行单文件 HTML。

| 源码中没有写死轨迹,也没有使用随机移动,而是建立了网格、门、人员、烟雾、出口和计划事件的独立状态,并以 0.5 秒为固定逻辑步长逐步推进。 播放 下一个 打开循环播放 00:00 / 00:00 倍速 3.0X 2.0X 1.5X 1.25X 1.0X 0.75X 0.5X 多音轨 AirPlay 0 静音播放中,点击 恢复音量 画中画 网页全屏 全屏 你可以 刷新 试试 视频信息 1.33.6 播放信息 上传日志 调试信息 [X] 视频ID VID - 播放流水 Flowid - 播放内核 Kernel - 显示器信息 Res - 帧数 - 缓冲健康度 - 网络活动 net - 视频分辨率 - 编码 Codec - mystery mystery - 按住画面移动小窗 我们首先在初始门状态下调用页面自己的 A* 寻路逻辑,检查 12 名人员到最近出口的路径长度。

| 十二个结果与验收基准完全一致。这意味着墙体展开、门格位置、两个出口坐标和四方向移动规则都没有解释错误。

| 路径搜索使用普通格代价 1、烟雾格代价 8,并以到两个出口的最小曼哈顿距离作为启发函数。每个逻辑步都会根据当前门状态和烟雾区域重新规划,而不是在开始时生成一条永不改变的路线。 Case 3 的意义在于要求 Qwen 同时维护空间、时间、人员、烟雾、门和出口六类相互影响的状态,而模型在首轮交付中通过了最关键的数值基准和事件边界。相比 Case 1 的视觉复刻,这更接近大模型在真实工程中的价值:它未必把每个细节都做到产品级,却能够从一份自然语言规则出发,建立一个可运行、可解释、还能被严格验证的系统。 (四)网页 3D 魔方 第四题要求模型从零实现一个真正可玩的 3×3×3 网页魔方:不仅要有 26 个立体块体和分层旋转动画,还要正确维护六面转动、算法队列、撤销重做、25 步确定性打乱、逆序复原以及供隐藏测试调用的 cubeTestAPI。 从运行记录来看,Qwen 3.8 Max Preview 对任务难点理解得相当深入。它主动检查了动画速度、prefers-reduced-motion、applyAlgorithm() 的默认参数、非法算法的原子拒绝、打乱种子的确定性、撤销重做历史以及animate:false 下的 Promise 语义。

| 它甚至已经开始考虑如何提取魔方引擎脚本并运行契约测试,说明其设计思路并没有停留在画一个“看起来像魔方”的界面。 但这一次,过程没有转化成结果。在完成 HTML 写入和正式测试之前,任务出现Internal error: terminated bug。 (五)从结构化数据到成片 最后一题要求模型根据两条异常事件和一组恢复数据,直接生成一支可以播放的 MP4。 播放 下一个 打开循环播放 00:00 / 00:00 倍速 3.0X 2.0X 1.5X 1.25X 1.0X 0.75X 0.5X 多音轨 AirPlay 0 静音播放中,点击 恢复音量 画中画 网页全屏 全屏 你可以 刷新 试试 视频信息 1.33.6 播放信息 上传日志 调试信息 [X] 视频ID VID - 播放流水 Flowid - 播放内核 Kernel - 显示器信息 Res - 帧数 - 缓冲健康度 - 网络活动 net - 视频分辨率 - 编码 Codec - mystery mystery - 按住画面移动小窗 这一次 Qwen 成功完成了最终交付。生成的 astraops-incident-review.mp4 为 1920 × 1080、30fps、15 秒,共 450 帧,采用 H.264 编码和 16:9 画幅。视频没有使用真人、机房或无关素材,而是以 AstraOps 的深色网格、数据卡片、折线和流动节点构成完整的动态图形叙事。 五个关键时间点全部出现了规定内容:片头展示 AstraOps 标志和“AI 服务异常复盘”;Kestrel-R1 阶段准确呈现 4,200ms、95.50%、+49.35% 和“严重”;Nova-Pro 阶段呈现 3,350ms、97.00%、+27.66% 和“警告”,没有把恰好 97% 错写成低于阈值;恢复阶段则正确展示 2,448→2,006ms、-18.05%、98.07→98.69% 和 +0.61 个百分点。结尾以“让每一次异常都可解释”和 Detect · Explain · Recover 完成收束。

| 视频并非四张静态页面的简单硬切。异常阶段的延迟折线会随时间上升,恢复阶段的延迟与成功率曲线分别向改善方向运动,卡片、节点和数据线承担了镜头衔接。所有文字和数字都是程序化绘制,因此停留期间没有生成式视频常见的跳字、融化和标志变形。 主要问题出在对比度。

| 片头日期、部分指标卡、恢复阶段的旧值以及结尾英文使用了较低透明度,在深色背景上显得过暗。

| Case 5 证明 Qwen 3.8 Max Preview 的交付边界并不局限于网页和代码。它能够读取结构化事件,组织时间轴,再通过程序化渲染输出符合规格的最终媒体文件。虽然视觉精修还没有达到专业动效团队的水平,但从一份 JSON到一支可直接播放的复盘视频,这已经是一个完整而有效的生产闭环。 结论 成功交付的四项任务表明 Qwen 3.8 Max Preview 能够理解视觉输入,建立数据产品,维护复杂仿真状态,并把结构化信息转化为最终媒体文件。尤其是 Case 2 和 Case 3,模型不仅做出了正确的界面,还通过了加权指标、时间边界、路径规划和烟雾扩散等确定性校验。这类能力比一张公开榜单更接近开发者真正需要的生产力。 它最突出的优势,是对复杂需求的结构化拆解能力。面对长提示词时,Qwen 通常能够识别哪些内容属于数据层、状态层、表现层和测试契约,并将它们组织到同一个交付物中。Case 2 的统一筛选状态、Case 3 的固定时间步与动态重规划、Case 5 的数据驱动时间轴,都体现了这一点。 它的第二个优势,是首轮交付的完整度。除 Case 4 外,其余任务都不是代码片段或半成品说明,而是可以直接打开、运行或播放的文件。模型也表现出较强的离线工程意识:使用原生 SVG、Canvas、CSS 和本地编码链路完成任务,没有依赖外部框架掩盖实现难度。

| 但短板同样明确。 它最突出的优势,是对复杂需求的结构化拆解能力。面对长提示词时,Qwen 通常能够识别哪些内容属于数据层、状态层、表现层和测试契约,并将它们组织到同一个交付物中。Case 2 的统一筛选状态、Case 3 的固定时间步与动态重规划、Case 5 的数据驱动时间轴,都体现了这一点。 它的第二个优势,是首轮交付的完整度。

| 除 Case 4 外,其余任务都不是代码片段或半成品说明,而是可以直接打开、运行或播放的文件。模型也表现出较强的离线工程意识:使用原生 SVG、Canvas、CSS 和本地编码链路完成任务,没有依赖外部框架掩盖实现难度。 但短板同样明确。 第一是视觉精修。Qwen 能判断页面由哪些元素构成,却不总能准确估计绝对尺度、留白和信息对比度。Case 1 的整体缩小和 Case 5 的暗色文字都属于同一种问题:结构正确,最后一轮设计校准不足。 第二是边界收尾。

| Case 2 的时间筛选会丢失成本环比基线,Case 3 的复杂占位依赖存在理论风险,Canvas 人员选择也没有完整的键盘通道。这些问题不会破坏默认演示,却可能在真实用户和复杂输入下出现。

| 第三,也是最重要的一点,是长任务稳定性。Case 4 中,模型已经分析到 API 默认值、算法原子性、动画 Promise 和隐藏契约测试,却在交付前因内部错误终止。对于开发者而言,一次没有落盘的中断足以抵消大量高质量推理。模型能力的上限很高,但能否稳定走到终点,仍然决定了它是否可以被放心放进无人值守的工作流。

| 它的能力上限已经进入前沿第一梯队,优秀案例甚至接近可投入代码评审的水平;但视觉精修、极端边界和长任务成功率,仍然决定了它距离最可靠的旗舰模型还有多远。 至于 2.4 万亿参数的开放权重版本能否保持同样能力、推理成本是否可控、社区能否真正部署,以及这次中断是偶发事件还是稳定性信号,都需要等权重、技术报告和更多独立复测出现后才能回答。 但有一点已经可以确认:Qwen 3.8 Max Preview 不是只靠参数规模制造声量。至少在这组测试中,它确实交出了几份足以让闭源旗舰认真对待的作品。 Ref: https://explainx.ai/blog/qwen-3-8-max-preview-open-weight-token-plan-july-2026 作者: Wang Shijie。
Current article:http://www.chuandanfozhuanbenglipaicuzi.pics/news/20260826_9117.html
Published on:03:46:26
