选择你喜欢的标签
我们会为你匹配适合你的网址导航

    确认 跳过

    跳过将删除所有初始化信息

    您的位置:0XUCN > 资讯 > 动态
    新闻分类

    腾讯发布混元Hy3极致量化版本:单卡就能跑!总参数295B

    动态 PRO 稿源:快科技 2026-07-14 17:44

    0XU.CN

    腾讯混元官方宣布推出混元Hy3极致量化版本,单张高端显卡即可本地运行超大规模MoE大模型。

    Hy3是腾讯自研混合专家架构旗舰模型,总参数295B,原生推理仅激活21B参数,支持256K超长上下文,在代码生成、智能体调度、长文档理解等任务表现比肩更大规模海外旗舰模型,但原生BF16权重文件达598GB,硬件部署门槛极高。

    为降低开发者使用成本,团队完成梯度量化压缩,推出三版适配不同场景的量化方案:

    -极限轻量化IQ1_M(1bit)版本权重仅85.5GiB,压缩幅度达6.7倍,单张96GB推理显卡即可完整承载,适合硬件资源有限的本地离线使用;

    -Q4_K_M(4bit)量化包体积169.9GiB,双显卡可稳定运行,模型输出精度无限贴近原生满血版本;

    -GPTQ Int4版本原生适配vLLM推理框架,依托高并发、低延迟特性,面向企业线上API服务场景。

    实测数据显示,本次量化方案在大幅压缩显存占用的同时,模型核心能力衰减控制在极低水平。

    4bit版本输出概率分布、Top-K选择与BF16原版基本保持一致,多语言代码、工具调用、长文解读、Agent任务评测成绩几乎无明显下滑。

    即便极致压缩的1bit版本,长文本理解能力近乎无损,代码、智能体任务仅小幅回落,完全可以满足日常问答、文档处理、编程辅助等通用需求,打破“低比特量化必然大幅降智”的行业痛点。

    为进一步优化本地交互流畅度,腾讯针对性开发llama.cpp专属补丁,补齐框架对Hy3原生MTP多令牌投机解码机制的适配。

    开启MTP加速后,令牌接受率稳定维持60%左右,1bit量化版本解码速度提升约50%,4bit版本提速接近60%,大幅缓解本地大模型生成卡顿问题。

    0XU.CN

    [超站]友情链接:

    四季很好,只要有你,文娱排行榜:https://www.yaopaiming.com/
    关注数据与安全,洞悉企业级服务市场:https://www.ijiandao.com/

    图库
    公众号 关注网络尖刀微信公众号
    随时掌握互联网精彩
    赞助链接
    热门AI排行
    排名 热点 热门指数