今年的WAIC堪称史上规模最大的一届,也是芯片算力行业最为瞩目的一次盛会。国内知名算力企业几乎全员到齐,集体“秀肌肉”——108款AI芯片、200余款智算设备同台竞技;重达数百公斤、塞满核心器件的超节点真机机柜,成为现场最为吸睛的展品之一。
在逛展过程中,一家成立仅5年、首次以合作伙伴身份亮相WAIC的算力企业脱颖而出,引起了记者的注意。它没有只讲“单卡算力”“峰值性能”,而是重点关注底层芯片的赛道创新;不止展出前沿的超节点集群,还把应用于气象预测、药物研发的多个AI For Science(以下简称“AI4S”)落地案例搬上了展台。太初(杭州)集成电路有限公司(以下简称“太初元碁”),这家核心成员来自国家超级计算无锡中心和清华大学计算机系的企业,给出了“算力企业应该向何处去”的独有答案。
芯片的爆发机遇一定来自行业
近年来,以大模型为代表的新一代人工智能快速崛起,推动科学研究成为人工智能落地应用的重要阵地。上海人工智能实验室主任、首席科学家周伯文披露了两则数据:过去十几个月,AI Coding的任务成功率从约5%升至88%;与之相对,端到端科学发现评测中最好模型的任务完成率仍停留在约3%。他表示:“科学研究是下一个Coding,也是突破AI智能上限的终极考题。”
中国科学院院士钱德沛也指出,过去几十年习惯的“用计算求解问题”的模式正在发生变化,从建立数学方程进行数值模拟,转向“AI赋能”的数据驱动模式。以天气预报为例,过去数值模拟需计算两小时,现在大模型推理仅需几分钟即可完成。他表示:“我们应该认识现在变化的这个世界,把握大变革的时机,促进计算和智能的协同,来推动整个应用的落地。”
这与太初元碁的思路不谋而合。本届WAIC上,太初元碁重点推出了HyperIntelliX超智融合计算系统,定位为面向AI+AI4S的全国产智算与超算融合计算平台,可支撑万亿参数大模型训推与AI4S科学计算双重需求;同时披露了其在三大AI4S领域的落地成果:全球气象预测可视化系统、TecoQSim量子经典模拟器、大规模虚拟药物筛选,覆盖气象、量子计算、生物医药等多个科学计算方向。
此外,同步亮相的新一代国产AI4S计算平台,也专门面向AI4S场景打造,针对科学计算高并发、大吞吐量、长时任务稳定运行等特点做了专项优化,整合算力调度、作业管理、开发环境、科学计算套件等能力,能为气象、海洋、材料、生物、物理等科研领域提供一体化的AI算力支撑。
“我们相信,算力时代一定会产生几个新的世界级的芯片公司。”太初元碁CEO杨晋喆在接受《中国电子报》及其他媒体采访时表示,“跑出来的公司一定是以时代需求为技术导向。”
服务于具体行业正是太初元碁所看好的方向。“芯片卖得好,主要是因为芯片所支持的行业场景需求量起来了,芯片才会跟着一起起来。我们认为以后AI的爆发点一定是在行业,所以在设计芯片时就已经绑定着行业去做。”杨晋喆向记者分享了太初元碁的设计思路。
算力产业进入系统级竞争阶段
尽管AI4S应用前景广阔,但想让算力真正赋能现实场景并非易事。当前,算力产业已从单卡性能比拼进入系统级竞争阶段,是体系化能力与生态协同效率的综合较量。随着模型参数突破万亿级、Token工厂向GW级演进、Agent与AI4S对CPU-GPU协同提出更高要求,降低单位算力成本成为核心命题。
芯片企业究竟应该如何解决接踵而来的新问题?杨晋喆给出的答案是HCU异构融合计算架构,即CPU与AI算力核通过统一高速总线互联,支持M:N可重构配比,CPU侧承担Agent调度与数据预处理,XPA算力阵列专注大模型推理计算;配合共享分级存储架构,实现冷热数据动态调度,兼顾容量与带宽。
“早期大家对人工智能都有各自的路径想象,不少企业选择了GPU的道路。但随着Agent(智能体)的兴起和大模型编程能力的解锁,人工智能的产业落地场景已变得极其复杂,绝非单一架构所能解决。”杨晋喆直言,太初元碁从成立之初就预判到了未来复杂多变的业务场景,并据此设计架构。随着市场演进,这种预判正逐渐转化为独特的竞争优势。
相较于仅聚焦单一模型计算环节的DSA、ASIC专用架构,HCU异构融合的创新设计可以让单颗芯片同时兼顾科学计算的高精度与智能计算的高效率,每一颗芯片均可构成高性能的微型“超算节点”。据了解,太初元碁最新推出的AI自研异构众核芯片T2 Ultra,即具备双模式设计特点:自主计算模式下可独立承担完整计算任务;加速计算模式下可配合主机工作,灵活适配不同部署场景,可适配包含大模型矩阵计算、高性能计算以及AI4S通用计算的多种需求,完整支持从FP4到FP64的全精度计算。具体来看,T2 Ultra芯片的HPC算力(FP64)为38 TFLOPS,可满足科学计算需求;FP4算力高达4800 TFLOPS(稀疏算力),FP16算力为1200 TFLOPS(稀疏算力),可应对各类AI训推场景。T2 Ultra芯片互联带宽达800GB/s,搭载太初元碁自研Switch芯片及高速互联协议,单机最大支持128卡直连互联,大幅突破行业普遍单机8卡的组网上限,为十万卡级超大规模集群提供硬件基础。
更进一步,太初元碁基于T2 Ultra芯片,推出了面向下一代人工智能、高性能计算全场景的通用计算平台,兼顾算力效率、系统扩展性与行业适配性,可全方位覆盖AI智能计算与高端科学计算的各类需求,突破传统算力芯片仅能完成单一模型计算的局限。
依托这套硬件底座与配套的AI4S计算平台,太初元碁在展台现场展示了数个具有代表性的落地案例。例如,在气象预测领域,其联合百度打造了全球气象预测可视化系统,将过去耗时巨大的10天全球气候预报推演压缩至3分钟以内,耗时仅为传统预报方法的0.01%;在量子计算领域,与清华团队合作研发TecoQSim量子经典模拟器,在16—32量子比特范围内实现437—1250倍加速;在生物医药领域,通过大规模虚拟药物筛选平台大大加速药物筛选进程。
以生态共建汲取源头活水
算力生态的突破,还离不开前沿科研土壤的滋养与产业伙伴的配合。在WAIC上,太初元碁同步官宣了与高校、科研机构、企业伙伴共同发起的“AI4S国产算力创新生态校企共建倡议”,表示将在算力资源开放共享、科研课题联合攻关、人才联合培养等方面建立常态化协作机制,推动国产算力与AI4S的深度融合。
记者在会上了解到,太初元碁已与北京大学、上海大学、中国科学院数学所、华东师范大学、清华AIR、湖南大学、山东大学、江南大学等9家高校及科研机构开展合作。在杨晋喆看来,与高校的合作并非短期的商业买卖,而是长期的生态赋能。他表示,高校汇聚了尖端的开发者人才,与其合作有助于太初元碁站在更前沿的视角看待行业问题,同时为未来的商业化进程打下坚实根基。
针对算子开发、软件适配等新架构必然面临的庞大工程量,太初元碁还务实地选择了开源社区路径。据介绍,太初元碁人工智能开发者社区2.0现已正式发布。相较前一代社区,在软件开发工具包数量、社区内容丰富度、开发者人数、开发合作伙伴规模等方面皆有显著跃升。为降低开发者迁移成本,社区现已完成Megatron-LM、DeepSpeed、飞桨PaddleHelix、PyTorch、vLLM等主流训练与推理框架的适配,提供模型分析、迁移、算子开发、性能优化、精度调试全流程开发工具,涵盖Profiler性能分析、Precision精度对齐、Evalscope评测、SDAA异构计算语言、PCX编译器、TecoCopilot、TecoGDB调试器等系列工具。
“算力芯片行业最怕的不是被客户吐槽不好用,而是因为不好用而不敢去面对真实客户。”杨晋喆表示。如今,算力产业正在摆脱粗放建设模式,加速转向以应用效率和用户反馈为核心的新阶段。对于成立已五年的太初元碁而言,也正面临迈向商业化落地、争夺下一代AI计算体系话语权的关键转折期。
“今年,我们在位于郑州航空港的河南空港智算中心实现了大规模集群的落地突破。”杨晋喆透露道,“此次参与WAIC,也是希望链接更多产业伙伴,共同扩大行业影响力。”
从底层硬件到上层应用,杨晋喆表示,太初元碁的定位不是单纯的芯片公司,而是从芯片到并行化系统、再到软件生态环境的完整算力底座提供商。“国产算力的真实产业价值,终将在千行百业的真实业务场景中得到全面验证。”(记者 陈存)
转自:中国电子报
【版权及免责声明】凡本网所属版权作品,转载时须获得授权并注明来源“中国产业经济信息网”,违者本网将保留追究其相关法律责任的权力。凡转载文章及企业宣传资讯,仅代表作者个人观点,不代表本网观点和立场。版权事宜请联系:010-65363056。
延伸阅读