8月,国内大模型赛道迎来密集迭代窗口期,智谱、阿里、深度求索等头部厂商接连发布新版模型,行业技术内卷与落地竞速持续升级。8月28日,腾讯正式发布并开源新一代大语言模型混元Hy4 preview,凭借超大上下文、更强生产力能力、递归自我优化等多重技术突破,跻身开源大模型第一梯队,进一步夯实腾讯AI“模型+场景+工程”的差异化竞争壁垒。
据腾讯官方披露,混元Hy4 preview在模型架构与基础能力上实现全方位升级,整体规模达770B总参数、49B激活参数,上下文长度突破100万Token,可完整处理超长文档、复杂工程代码、大规模科研数据,适配企业级复杂生产任务。依托预训练与后训练全链路优化,新版模型综合智能水平实现跨越式提升,综合能力稳居国内开源模型第一梯队。

区别于行业部分主打通用对话的模型,混元Hy4 preview精准锚定生产力落地核心定位,深度联动腾讯内部WorkBuddy、CodeBuddy、元宝、ima等全线AI产品,通过产品协同共创(Co-Design)打磨真实场景体验。模型依托软件工程、游戏研发、金融分析、网络安全等领域顶尖专家的高质量数据共建,针对性强化产业级任务处理能力,告别通用模型“泛而不精”的短板。
权威盲测数据印证其顶尖实力。在腾讯内部组织的163名行业专家、203项真实工程任务盲测中,混元Hy4 preview取得2.99/4.0的高分,小幅超越同期主流开源模型GLM 5.3(2.92分)与Kimi K3(2.94分),在复杂工程落地、精细化任务处理、长文本逻辑推理等硬核能力上实现领先。
场景落地层面,Hy4 preview实现多领域能力全面跃升。软件工程场景中,模型强化长周期开发任务的规划、编码、调试与全流程验证能力,同时优化前端视觉交互与界面审美,适配完整项目开发需求;办公分析场景下,升级复杂文档理解、跨文件协同、多维数据分析能力,可独立完成从信息梳理、数据研判到文档、表格、演示文稿输出的闭环交付;游戏开发领域,支持单句需求快速生成可玩原型,熟练适配主流游戏引擎,可通过多轮交互迭代打磨复杂项目;科研场景中,大幅提升基础数学、凝聚态物理、分子动力学模拟等前沿领域的推理与求解能力,赋能科研创新。
本次新版模型最大技术亮点在于实现AI递归自我改进,开启自研闭环迭代新模式。Hy4 preview首次全程参与自身研发优化,可自主优化训练方法、数据策略、评估体系与底层算子,通过自主提出方案、运行实验、复盘迭代,将过程中的代码、日志、反馈数据反哺下一轮研发,形成可持续的自我进化闭环。同时,模型自主完成算子融合、通信优化等底层技术升级,端到端推理吞吐较基线提升31.8%,在不同上下文长度、并发场景下均保持稳定高性能,展现出强劲的基础设施自主优化能力。
普惠落地层面,Hy4 preview已全面开源,并在WorkBuddy、CodeBuddy国内外版本、元宝、ima等腾讯全系AI产品同步首发。同时模型开放腾讯云Tokenhub、OpenRouter双API接入通道,降低企业与开发者使用门槛。定价延续高性价比普惠策略,输入定价6元/百万tokens、输出18元/百万tokens,缓存命中仅0.3元/百万tokens,大幅降低产业AI落地成本。为持续收集真实场景反馈、迭代优化模型,WorkBuddy与CodeBuddy同步开启为期两周的限时免费体验活动。

国内旗舰大模型价格对比
自2月重建基础设施以来,混元大模型平均每两个月迭代一次大版本。通过 preview 先行、正式版跟进的方式,混元把真实世界的反馈持续引入研发过程,让模型在解决实际问题中进步。按照这一节奏,Hy4的下一版模型也将在近期陆续上线。
从行业来看,8月中旬,深度求索上线DeepSeek V4 Pro正式版,升级百万级上下文与智能体能力;8月下旬,阿里通义千问推出Qwen3.8系列新版模型,以高性价比、全模态能力拓宽落地场景;智谱AI同步开源GLM-5.3-Flash模型,主打轻量化高效推理。业内分析认为,8月行业新一轮模型扎堆发布,标志着头部厂商密集更新迭代,标志着大模型竞争已从参数比拼,全面转向真实生产力、工程落地效率、场景适配能力的综合较量。
文/广州日报新花城记者:倪明
广州日报新花城编辑:龙嘉丽