《大模型数据:原理、技术与实战》
把数据,变成大模型能力
- 作者何聪辉,吴郦军,张文涛
- 出版社电子工业出版社
- 出版日期2026-04-01
- 页数200
- 装帧平装
- ISBN编号9787121523748
- 标签AI教研图书AI大模型图书
- 系列通用智能与大模型丛书
内容简介
《大模型数据:原理、技术与实战》是一本聚焦大模型核心底座的数据工程专业著作,跳出单纯的模型算法讲解,立足“数据决定大模型上限”的核心逻辑,系统梳理大模型数据全生命周期的原理体系、核心技术与落地方法,填补了大模型数据工程实操领域的内容空白。
全书内容层层递进、兼顾理论与落地。基础层面,详细拆解大模型数据核心原理,清晰区分预训练、微调、RAG等不同场景的数据特征,阐明数据质量、数据分布与模型性能的内在关联,帮助读者搭建完整的大模型数据知识框架。技术层面,全面覆盖数据核心工程链路,涵盖海量数据采集、精细化清洗、结构化解析、专业标注等基础工序,同时深入讲解通用、代码、多模态数据合成与增强技术,以及多维度数据质量评估体系。
《大模型数据:原理、技术与实战》本书兼顾前沿合规与产业落地,专门探讨大模型数据的版权保护、隐私安全、合规监管等行业痛点问题,贴合当下AI产业规范化发展需求。同时摒弃空洞理论堆砌,搭配PDF垂类模型优化等真实实战案例,完整还原从数据处理、模型优化到落地应用的全流程,实操性极强。
本书适合AI算法工程师、数据工程师、技术从业者及高校相关专业师生阅读,是一本系统掌握大模型数据工程技术、实现从理论认知到实战落地的优质专业读物。

作者简介
👤 何聪辉
清华大学博士,上海人工智能实验室青年科学家、大模型数据负责人,商汤科技高级研究总监,入选第五届上海科技青年 35 人引领计划。长期深耕高性能计算与 AI 数据基础设施交叉领域,专注通用人工智能数据基座建设。在国际计算机顶会发表论文 200 余篇,谷歌学术引用超万次,曾获戈登・贝尔奖、ACL 最佳主题论文奖等重要奖项。主导开源智能文档解析引擎 MinerU,GitHub 星标 5 万 +,被国内百家企业落地使用;搭建开放数据平台 OpenDataLab,构建的 OmniDocBench 评测基准被 Gemini、GPT 等国际大模型官方采纳。
👤 吴郦军
上海人工智能实验室青年科学家,上海交通大学、复旦大学博士生导师,上海市高层次青年人才计划入选者。主要研究方向为大模型、数据智能与 AI for Science,在 Nature 子刊及国际顶级会议发表论文 90 余篇,担任 ICML、NeurIPS、ICLR、ACL 等顶会领域主席,NeurIPS 2026 E&D Track 主席。曾获微软亚洲研究院微软学者奖学金,作为核心成员拿下 WMT 全球机器翻译大赛多项冠军,在大模型数据合成、多模态数据治理、科学 AI 方向拥有丰富科研与工程实践经验。
👤 张文涛
北京大学研究员、博士生导师,上海人工智能实验室科研顾问,曾任职腾讯、Apple AIML、加拿大 Mila 人工智能实验室。研究聚焦以数据为中心的机器学习、大模型数据构建、AI for Science,主持国家自然科学基金等多项国家级科研项目上海人工智…。在 ICML、NeurIPS、ICLR 等国际会议发表百余篇论文,多次斩获国际学术竞赛奖项,开源 DCML 大模型数据处理工具链,长期从事高质量训练数据、数据增强、数据评估的技术研究,推动大模型数据技术学术界与产业界的结合落地。










京公网安备11010502052249号