选择你喜欢的标签
我们会为你匹配适合你的网址导航

    确认 跳过

    跳过将删除所有初始化信息

    您的位置:0XUCN > 资讯 > 动态
    新闻分类

    StartLux通过可信AI大模型基准测试-MCP专项测试

    动态 PRO 作者:Mini肉 2026-09-01 03:26

    0XU.CN

    近年来,模型上下文协议(Model Context Protocol,MCP)作为连接大模型与外部数据源、工具及应用的核心技术基础,正受到国内外大模型厂商与开发平台的广泛关注和深度应用。

    为进一步评估大模型在工具调用与智能体协同方面的真实能力,中国信通院开展大模型基准测试——MCP 专项测试,围绕实际应用场景设置位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理、3D设计六类专项任务,并在此基础上开展综合能力评估,重点考察大模型在多工具协同、复杂任务执行及真实环境交互等方面的综合表现,该专项测试部分指标和数据参考了开源项目MCP-Universe[1]。

    2026年8月,上海原点星辉科学技术有限公司(以下简称“StartLux”)参与由中国信息通信研究院组织开展的可信AI大模型基准测试——MCP专项测试,其自主研发的大模型StartLux-V1.0-27B-Preview顺利通过评估。评估结果显示,该模型综合性能表现优异,总体任务通过率达到39.25%。在各专项任务中,StartLux-V1.0-27B-Preview在位置导航任务中的平均通过率为33.33%,网页搜索任务为42.42%,浏览器自动化任务为28.21%,金融分析任务为68.33%,代码仓库管理任务为17.17%,3D设计任务为43.86%。本次评估结果表明,在基础模型基础上,针对特定任务开展后训练与定向能力增强,能够进一步提升模型在复杂场景下的任务执行效果。该模型的测试表现也表明,通过针对性的数据构建、训练优化与能力增强,轻量级模型同样能够在特定智能体任务中实现较好的综合表现。


    图 1  StartLux参数量级与评测分数

    【StartLux-V1.0-27B-Preview产品介绍】

    (以下介绍信息由上海原点星辉科学技术有限公司提供)

    StartLux-V1.0-27B-Preview 以 Qwen3.6-27B 为基座模型,是一款面向工具调用与通用 Agent 场景的 27B Dense 模型。StartLux训练数据的设计重点在于增强模型的任务理解、工具选择、参数构造、多步执行、状态检查和结果验证等能力,同时使其学会根据不同任务要求与工具反馈,来调整执行策略,在出现异常或结果偏差时主动修正、重新执行并确认任务完成。训练模型的过程中,团队采用AI 训练 AI(Auto Research)的方法,让模型在真实工具环境中自主完成任务,通过环境反馈持续优化自身能力。


    上海原点星辉科学技术有限公司未知
    公司法人:罗永祥
    查看详情


    0XU.CN

    [超站]友情链接:

    四季很好,只要有你,文娱排行榜:https://www.yaopaiming.com/
    关注数据与安全,洞悉企业级服务市场:https://www.ijiandao.com/

    图库
    公众号 关注网络尖刀微信公众号
    随时掌握互联网精彩
    赞助链接
    热门AI排行
    排名 热点 热门指数