Qwen4预览架构:Qwen3.8去拒绝版实测本文解析采用Qwen4预览架构的Qwen3.8-Flash-Next去拒绝版,说明111GB GGUF分片、内存与上下文需求,并给出llama.cpp下载和启动方法,同时梳理量化差异、许可证、多模态验证及公开部署风险。2026-09-0790 浏览
GPT-6 Astra演示:从3D应用到专业工作流据公开演示,GPT-6 Astra已能生成可运行的Mac应用和游戏,并处理3D重建、数学证明、医学科普、电路设计与数据分析。不过相关案例缺少统一测试条件,是否达到AGI仍需在正式开放后通过长任务实测验证。2026-09-0494 浏览
GPT-6 Astra性能与定价解析据现有材料,OpenAI发布GPT-6 Astra,重点强化计算机操作、软件工程、科学推理与复杂工作流能力。本文整理其主要基准成绩、API定价、开放范围、Codex上下文机制及专业场景表现,并说明评测结果的适用边界。2026-09-04100 浏览
GPT-6 Astra发布消息核查网传文章声称OpenAI发布GPT-6 Astra,并给出ARC-AGI、网络安全、科研与电脑操作成绩。核查发现,材料缺少官方公告、系统卡、基准方法和可复现结果,多个结论不能据此成立。本文梳理主要疑点,并提供企业评估AI代理能力与安全风险的核查清单。2026-09-04101 浏览
Claude Computer Use支持后台操作Claude 在 macOS 桌面端测试后台 Computer Use,面向 Pro 与 Max 用户,可让 Cowork 和 Claude Code 在不抢占鼠标与前台窗口的情况下执行跨应用任务。本文梳理其效率价值、适用场景,以及静默操作带来的权限、误操作和敏感数据风险。2026-09-0391 浏览
OpenAI Astra触及关键网络安全门槛OpenAI披露Astra已达到Preparedness Framework的Critical网络安全门槛,在漏洞利用测试中表现突出并发现两个未知漏洞。其Token效率、安全拒绝率和审批遵从性也优于Sol,公众版本将采用更严格的权限与风险控制。2026-09-02113 浏览
Claude Fable 5.1:强大但非默认首选Claude Fable 5.1面向长周期、多工具和高失败成本的Agent任务,性能与上下文能力突出,但价格为Opus 5两倍。本文梳理其基准成绩、缓存成本、科研案例、安全边界、迁移注意事项及分层选型建议。2026-09-0295 浏览
Fable 5.1发布:科研与编程能力升级Anthropic 发布 Fable 5.1,重点强化科学研究、终端任务与编程能力,并将缓存读取价格下调 75%。本文梳理其基准成绩、分子设计与模型加速案例,以及金星地形建模和上海地图生成演示。2026-09-02210 浏览
MiniMax Design 发布:H3 视频生成创作工作流MiniMax 官方发布创作工作台 MiniMax Design,将开源视频模型 H3 接入从需求理解、分镜规划到自动剪辑的完整流程。实测显示,它支持电商种草、杂志风 MV、3D 导演台等场景,通过 Agent 驱动实现批量生产,标志着视频 Agent 从套壳走向原厂深度适配。2026-09-01108 浏览
GLM-5.3 量化239GB,Mac Studio 可跑GLM-5.3 原始权重达 1.51TB,经 Unsloth 动态量化后仅 239GB,2-bit 精度保留约 81%,可在 256GB Mac Studio 上运行。本文详解量化原理、内存门槛、性能对比及完整部署步骤,并介绍长上下文优化与思考档位设置。2026-08-30113 浏览
Minke v0.3.0:远程控制+Agent浏览器来了Minke v0.3.0 发布,核心是远程控制与 Agent 浏览器。支持通过微信、Telegram、Discord 远程下发任务,Agent 可自动打开网页、点击操作并截图,全程可人机协作。三种 Web 远程访问已验证,本地模型集成,数据本地优先,覆盖 Windows/macOS/Linux。2026-08-2955 浏览
DeepSeek发布多模态视觉模型,首批解读DeepSeek正式发布多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,API已开放调用。该模型支持读取图片、截图、图表中的文字与视觉信息,纯文本能力与V4-Flash一致,多模态Agent能力接近Opus-4.8。本文梳理模型细节、图片格式、接口调用方式、Token计费与消息限制,帮助开发者快速上手。2026-08-2953 浏览
GLM-5.3-Flash实测:原生多模态让网页与游戏生成门槛大降智谱GLM-5.3-Flash以匿名Ox Alpha身份发布,冲上OpenCode和OpenRouter榜首。实测显示,其原生多模态功能支持视频与图片输入,可复刻网页动效、生成可玩浏览器游戏,并制作滚动叙事个人站。320B参数开源,能力对标Opus 4.8,价格约为四十分之一。2026-08-2957 浏览
腾讯混元Hy4 preview实测:回归国产大模型第一梯队腾讯混元最新模型Hy4 preview实测:770B总参数、49B激活,支持1M上下文。在Coding、Agent和工具调用上表现突出,代码生成、马里奥复刻和SwiftUI重构三项测试中均优于GLM 5.2,盲测分数领先同代旗舰,回到国产大模型第一梯队。2026-08-2968 浏览
实测Qwen3.8-Flash:性能比肩Opus 4.6,价格仅为1/40实测 Qwen3.8-Flash:125B MoE 模型,每个 Token 仅激活 6B,支持 1M 上下文。实测能生成可玩 3D 游戏、完整 3D 场景和科技产品官网,输入每百万 Token 仅 0.8 元,输出 2.7 元,缓存命中 0.1 元,比 DeepSeek-V4-Flash 便宜,不到 Opus 4.6 的 1/40。2026-08-2946 浏览
TraeWork「电脑控制」上线:AI 办公最后一公里跑通TraeWork 上线电脑控制功能,用户用自然语言即可操作本地桌面软件,完成文件整理、数据汇总、行程准备等任务,也支持开发测试与企业内部系统重复流程;执行过程可实时查看,高风险操作需人工确认。2026-08-2156 浏览