7月17日,在2026世界人工智能大会暨人工智能全球治理高级别会议期间,一项重要科技基础设施"敖仓·科技语料库"正式亮相。这一由国家级机构主导的项目标志着我国在推动人工智能发展的新型基础设施建设方面取得重大进展。
高质量科技语料已成为推动科研模式变革的关键性资源。通过对多模态科学数据与科技文献进行深度加工和关联融合,可以形成高知识密度的智能就绪数据,这些数据直接决定着人工智能赋能科学研究的能力边界。中国科学院文献情报中心作为国内顶尖的研究机构,凭借其完整的科技文献保障体系、专业的数据处理能力以及跨学科研究的优势,为建设国家级语料库奠定了坚实基础。
目前,"敖仓·科技语料库"整合了海量的科研资源,包括超过320PB的科学数据、1.5亿篇科技论文、1.2亿件发明专利和500万本科技图书,并支持文本、图像、公式、化学式等多种数据形态。该语料库采用"1+7+N"的分层架构:一个全学科的数据融合中心,七个专业化领域的分支数据库以及多个场景化的应用子库,构建了涵盖数学物理、化学化工、天文空间等学科的科技语料供给体系。
除了服务科研领域,"敖仓·科技语料库"还在商业航天、低空经济、智能制造和生物医药等多个行业进行了深入的数据处理,并计划为元器件选型、超微病理诊断、高速列车外形设计等百余个应用场景提供支持。这些应用将极大提升相关领域的研发效率和创新能力。
未来,"敖仓·科技语料库"将继续遵循"共建、共享、共用"的原则,不断提升数据处理能力,完善科技语料生态体系,为我国科技创新乃至全球科技进步贡献力量。
