图书前言

前言

人类文明史在很大程度上也是一部工具史。从文字、印刷术到计算机,每种通用工具都会重新配置人的能力边界。今天,大模型正在成为一种新的认知工具。人与人之间的差异,未必来自“是否被AI取代”,而可能越来越表现为是否能够理解、判断并恰当地使用AI。以大模型为代表的AI技术,正在重塑人类社会的生产方式。它不仅在日常生活和工作场景中带来了前所未有的便利,更在科研、技术开发等高端领域展现出颠覆性的潜力。

如果说蒸汽机推动了工业革命,计算机引领了信息革命,那么大模型的崛起,正标志着智能革命的到来。以 ChatGPT、DeepSeek 等为代表的新一代 AI 模型,正逐步成为新时代的“智力引擎”,推动社会迈向更高水平的智能化发展。

在这场 AI 变革中,中国科技企业的创新能力不断显现。字节跳动的“豆包”、科大讯飞的“星火”、月之暗面(Moonshot AI)的Kimi,以及深度求索(DeepSeek)等,正各自在不同领域展现卓越的技术能力,助推人工智能生态的繁荣。

特别值得一提的是,DeepSeek凭借强大的推理能力和多模态应用,在多个行业实现突破。据部分公开统计口径,DeepSeek 在发布后短时间内实现了显著增长;相关数据因统计口径不同而存在差异,但其传播速度与社会关注度确实值得关注。

DeepSeek 的崛起打破了“高算力和高投入是发展人工智能唯一途径”以及“集成电路制程优势等同于人工智能技术霸权”的固有观念,引领人工智能行业迈入一个以算法与模型架构优化为核心,同时高度重视数据质量与规模,并理性提升算力的新阶段。

此外,DeepSeek 的成功不仅标志着中国科技公司从“追赶者”向“规则改写者”的转变,更意味着在全球备受关注的人工智能领域,中国企业正以颠覆性的创新挑战西方在 AI 领域的长期主导地位,重塑行业格局。

DeepSeek不仅在技术层面带来创新,如多头潜在注意力机制(MultiHead Latent Attention,MLA)、优化版的混合专家(Mixture of Experts,MoE)、多 Token 预测(MultiToken Prediction,MTP),更重要的是,它以免费开放的方式,让亿万用户触手可及。

低成本始终是技术普及的关键要素。回顾历史,蒸汽机、电力和计算机的广泛应用,都是在其成本下降至大众可接受范围后才得以实现的,人工智能的发展也遵循这一规律。然而,目前盲目追求高算力导致 AI 训练与部署成本居高不下,严重阻碍了人工智能的普及与应用。

DeepSeek 的崛起不仅是技术突破,更是规则的重构。它开辟了一条低成本发展人工智能的可行之路,打破了“算力至上”的固有思维。DeepSeek 的成功表明,AI 发展不再仅依赖于算力的堆砌,而是进入了一个以追求更高算效比(计算效率)和更优能效比(能源利用率)为核心的新阶段,为人工智能的大规模应用提供了新的可能性。DeepSeek 的崛起极大地推动了中国乃至世界的 AI 市场普及与教育,让大模型真正“飞入寻常百姓家”,为科技平权铺平了道路,加速了AI 渗透率的提升,也为中国 AI 产业革命的爆发奠定了坚实基础。

正如工业革命中蒸汽机推动了人类生产力的跃迁,如今的大模型,正以“智力引擎”的角色引领信息社会迈向新的高度。这一技术的深远影响,正在悄然改写人们的未来图景。

面对这一场智能革命,我们又该如何迎接甚至驾驭它?

事实上,古人早已为我们提供了答案。《荀子·劝学》有言: “君子生非异也,善假于物也。”意思是,君子的资质与普通人无本质区别,真正让他们卓尔不群的,是善于借助外物的力量。善于利用已有的外物,正是君子通往成功的重要法门。

在大模型时代,这句古训仍然适用。AI已成为人类最重要的“外物”,善加利用它,才能在这场变革中立于不败之地。那些善于运用大模型的人,或许将成为未来的创新者、探索者;而那些对AI置之不理的人,可能会逐渐被时代甩在身后。

正是在这样的背景下,本书应运而生。它不仅是一本介绍大模型技术的指南,也是一把帮助读者理解并掌握未来核心技术的钥匙。

本书将从理论基础到技术实现,再到应用前景,全面解析大模型的奥秘。无论你是对AI充满好奇的普通读者,还是希望深度理解技术的专业人士,都能在本书中找到有价值的内容。

本书共10章,内容循序渐进,引导读者从基础知识逐步迈向前沿应用,系统呈现大模型的全貌。

第1章绪论,为整本书奠定了基础,介绍大模型的基本概念、发展背景和时代意义,并通过图灵测试、中文屋子和亿年机器人等经典思想实验,探讨人工智能的判断标准与技术边界。

第2章语言模型的哲理基础,回顾了语言模型从统计方法到大型预训练语言模型的发展历程。通过历史视角,读者可以清晰地了解这一技术的演变轨迹,以及其在自然语言处理领域所实现的一个个里程碑式的突破。

第3章神经网络与深度学习,解析大模型的核心支撑技术,涵盖神经网络基础结构、深度学习原理及其在大模型中的应用。

第4章深度序列模型,梳理RNN、双向RNN、LSTM、GRU及Seq2Seq等序列模型的演进过程,解析其在时间序列任务中的关键作用。

第5章注意力机制与Transformer,深入探讨注意力机制的工作原理,剖析Transformer模型及其创新之处,如自注意力计算方法。

第6章大模型的部署与使用,解析大模型从训练到应用的全过程,介绍DeepSeek的本地部署步骤及LM Studio对Llama的高效运行方案。

第7章大模型的提示学习,讲解如何利用提示词引导DeepSeek等大模型生成目标输出,并展示其在多任务适配中的应用。

第8章大模型微调,介绍大模型微调实践,展示如何使用Unsloth微调Llama,并探讨微调在任务适配中的潜力。

第9章LLM智能体实践,聚焦于如何构建具有感知、思考与行动能力的大模型智能体。

第10章大模型认知边界与安全对齐,把讨论引向更深层的问题: 当模型能力持续增强,如何认识其局限性、理解其风险,并在安全、伦理、对齐与治理层面建立更加可靠的技术秩序。

本书不仅是一部技术指南,还是一部蕴含哲学思辨之作。它融汇了理论与实践的精髓,既有对核心技术的深入剖析,也展现了广泛的应用前景和深刻的哲学思考。我们希望通过这本书,为广大读者提供具有深远价值的知识与洞见,激发他们对大模型领域的浓厚兴趣和探索热情。

本书由河南工业大学张玉宏副教授担任主编,统筹图书的资料收集和编写,编写第2章、第5章至第10章。河南工业大学李鹏教授编写第1章。西南大学苟建平教授编写第3章,河南工业大学蒋玉英副教授编写第4章。科大讯飞AI高校人才培养业务线总监张承云担任本书审校。

从构思大纲、查阅资料、撰写内容、绘制图片,到出版成书,历经三年打磨,本书得益于多方面的帮助和支持。在信息获取上,作者在各种参考资料中学习并吸纳了很多精华知识,书中也尽可能地给出了文献出处,如有疏漏,望来信告知。在此,我对这些高价值资料的提供者和作者致以诚挚的敬意和感谢。同时,感谢河南省自然科学基金项目(262300420307)、河南省高等教育研究重点项目“‘教育+产业’双主体协同育人的产教融合共同体建设路径探索与实践”(2025SXHLX061)、河南省教育厅高等学校重点科研项目(27A520006)、河南省科普专家团项目(202602079)、河南省教育科学规划重点课题“共生视角下河南省新型现代产业学院高质量发展路径研究”(2025JKZD20),以及河南省研究生教育改革与质量提升工程项目(YJS2026YBGZZ15)的部分资助。

本书的顺利出版离不开许多人的鼎力支持。在此,我们特别感谢清华大学出版社的白立军、杨帆老师,他们在选题策划上给予了宝贵的指导;同时,河南工业大学的钟克针、左一涵、方燕超、张朔、赵洋、李璞、陈嘉钰、毛福林、高婧瑜、刘国震、来新璐等同学,在文字校对过程中付出了大量心血。对所有为本书付出辛勤努力的朋友们,我们深表感谢!

大模型是一个前沿而广阔的研究领域,作者深知学识有限,且由于时间与篇幅的限制,书中难免存在理解上的偏差或错误之处。恳请读者朋友们在阅读过程中,发现任何问题或不足时,不吝赐教。您的宝贵意见将是我们不断完善的动力,我们承诺及时修正,并对此深表感激。

张玉宏

2026年8月