GLM-5.3-Flash实测:原生多模态让网页与游戏生成门槛大降

Admin
57阅读
0评论
0点赞

智谱GLM-5.3-Flash以匿名Ox Alpha身份发布,冲上OpenCode和OpenRouter榜首。实测显示,其原生多模态功能支持视频与图片输入,可复刻网页动效、生成可玩浏览器游戏,并制作滚动叙事个人站。320B参数开源,能力对标Opus 4.8,价格约为四十分之一。

智谱最新开源的 GLM-5.3-Flash 模型,以匿名身份 Ox Alpha 在海外开发者圈发布后,不到一天便冲上 OpenCode 和 OpenRouter 榜首。它支持原生图片与视频输入,可以复刻网页风格、生成可玩的浏览器游戏,Coding 与 Agent 能力一并集成,而价格约为对标模型 Opus 4.8 的四十分之一。以下为实测记录。

视频生成网页:一句话复刻动态站点

过去看到一个动效出色的网站,很难用文字向 AI 描述清楚:镜头推多少、产品转到什么角度、滚到哪段换材质,都难以表达。现在可以直接录制网页视频发给 GLM-5.3-Flash,让它照着复刻。

模型会先把整段视频拆成一帧一帧地分析,逐步读取页面内容:用了什么材质、需要什么技术、每段是什么动效,然后生成对应网页。

视频生成网页示例

与原网站对比,细节仍有差距(比如树的模型不够到位),但基于一句话加一段视频的输入方式,效果已相当可观。后续通过微调树模型、材质和镜头位置,还能做得更好。

图像生成游戏:从参考图到可玩原型

输入一张风格图和一个越野车模型,要求模型制作一款可玩的浏览器游戏:保留参考图中的橙粉黄昏、明亮夕阳、几何废墟和暖橙色灯光,再补充玩法。

图像生成游戏参考与结果

生成后的游戏整体低多边形氛围与色调一致,红褐色荒原、几何废墟、暖橙光影都基本还原。玩家可以在场景中自由移动,前进、倒车、转弯、重力系统、摄像机跟随均已跑通,撞到岩石围栏会停下,驶过道具分数会增长。

游戏画面

除越野车模型外,道路、建筑、岩石、道具和地图均为模型自动生成。若进一步补充详细模型,视觉表现还会大幅提升。

图像生成个人页:滚动叙事作品集

给出一张长图,要求按图片中的粗线条、米白色背景、砖红与苔藓绿色块,建立一个英文个人作品集页面。模型采用典型的滚动叙事设计:以一条贯穿页面的路线从上到下串联内容,动画随滚动同步推进,向上滚动时反向播放。

个人页设计参考

GLM-5.3-Flash 将线条粗细、留白、平面色块和轻微错位感统一为整页视觉规则,结合其 Coding 能力,直接产出了一个可滚动、可交互的英文个人站。

写在最后

原生多模态与之前通过 MCP 调用外部视觉模型完全不同:模型能直接看到图片和视频,同时理解文字、人物、物体、动作与节奏。GLM-5.3-Flash 将原生多模态、Coding 和 Agent 集于一身,提供 1M 上下文,底层采用全新的稀疏注意力与线性注意力混合架构。

模型架构示意图

能力对标 Opus 4.8,价格约为其四十分之一。模型继续保持开源,320B 参数规模,国产卡均可部署。

上一篇腾讯混元Hy4 preview实测:回归国产大模型第一梯队下一篇Qwen4预览架构:Qwen3.8去拒绝版实测
评论0

暂无评论,期待您的发言...

发表评论