我国本地大模型首次国家级测评出炉 StartLux-27B打平万亿参数模型-新华网
新华网 > > 正文
2026 08/31 15:21:08
来源:新华网

我国本地大模型首次国家级测评出炉 StartLux-27B打平万亿参数模型

字体:

  近日,工信部中国信息通信研究院(以下简称“中国信通院”)人工智能研究所公布检验报告,上海原点星辉科学技术有限公司(以下简称StartLux)自主研发的本地大模型StartLux-V1.0-27B-Preview,在可信AI大模型基准测试——MCP专项测试中,综合性能位列第二,多项智能体任务排名第一。这代表着本地模型完成任务的能力取得了质的突破,中国AI的竞争能力持续增强。

  此次测试依据可信AI大模型基准测试——MCP专项测试,涵盖位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理、3D设计6类专项任务及综合评估,共7项检验项目,重点考察模型在真实工作场景中的工具调用、多步规划和任务完成能力。

  结果显示,StartLux-V1.0-27B-Preview综合得分为39.25,以约1个百分点差距仅次于1.6万亿参数模型DeepSeek-V4-Pro;超过284B参数的DeepSeek-V4-Flash-0731和198B参数的Step-3.7-Flash。该模型在位置导航任务中排名第一,浏览器自动化、金融分析等任务中也与1.6T参数的DeepSeek-V4-Pro并列第一或独占第一。

  与传统云端大模型不同,本地模型将AI推理能力部署在用户个人设备上,数据无需上传云端,在隐私保护、降低使用成本以及扩展本地数据应用边界等方面具有现实意义。

  StartLux CTO郭权玮博士介绍,StartLux-V1.0-27B-Preview可在消费级个人电脑上运行,意味着普通消费者无需昂贵的专业设备即可使用具备较强能力的AI。这对于推动AI在教育、医疗、科研、办公等各行业以及居民日常生活中的普及具有重要意义。

  业内认为,大模型产业正从技术能力展示转向应用价值验证。全球范围内,超大规模基础模型与更高效、更易部署的本地模型并行发展。不久前,Meta发布30B本地模型Muse Glimmer;Google推 Gemma 4 31B。StartLux-V1.0-27B-Preview的测试结果为这一趋势提供了产业侧验证,大模型正从云端走向桌面,从参数竞赛走向应用落地。

  事实上,中国大模型正在实现云端与本地双线领跑。云端模型方面,全球最大开源AI模型平台2026年春季报告显示中国研发的开源模型下载量已占全球总量的41%,超越美国位居世界第一,累计下载量突破100亿次;在全球主流大模型调用榜单上,排名前六位的模型全部来自中国团队;而如今,StartLux本地大模型为中国AI模型的竞争力再添新的有生力量。StartLux-V1.0-27B-Preview通过中国信通院权威测评,证明本地模型有能力拓宽AI应用的场景,助力AI普及和AGI的实现。

  据了解,StartLux计划年内推出第一代本地智能解决方案,用户可直接下载使用,无需复杂的部署和调试。从更长产业周期看,本地模型的价值不仅在于将云端模型“缩小”,更在于推动AI进入个人设备和企业内部环境。当竞争从“谁的模型更大”延伸到“谁能解决更多真实问题”,模型效率、数据安全、部署成本和应用需求将成为新的关键变量。

【纠错】 【责任编辑:马渭淞】