图书前言

前 言

经过二十余年的发展,“机器学习及其应用”(MLA)研讨会已成为国内机器学习领域的著名学术品牌,其历史大致可以分为四个阶段。创始阶段是 2002年至 2004年。MLA起源于 2002年陆汝钤院士在复旦大学智能信息处理开放实验室发起的“智能信息处理系列研讨会”,是当年支持的研讨会之一。是年 11月,周志华、王珏等十余位专家到复旦大学闭门讨论,举行了首届 MLA研讨会。2003年周志华在中科院计算所主持“神经网络及其应用”闭门研讨会,虽然大家学术热情高昂,但恰逢 SARS肆虐,报告人都是讲完立即设法撤离、难以深入交流。其后,周志华和王珏决定集中力量,将“机器学习及其应用”继续办下去, 2004年 11月在复旦大学主持举办了第 2届 MLA研讨会。此次除邀请报告人外,还有闻讯自发与会旁听的学者和研究生 100余人。自此, MLA研讨会的模式从闭门的学术讨论,变成了开放的学术交流。 

MLA起步阶段是 2005年至 2010年。当时机器学习在国内甚少有人问津,虽然周志华和王珏成功说动诸多专家与领导支持,2005年在国家自然科学基金委增加了三级申请代码“机器学习”,但机器学习领域获取科研经费仍极为困难。有鉴于此, MLA研讨会坚持不向参会者收取注册费。缺乏收入,研讨会难以为继。周志华拿出自己争取到的项目经费支持 MLA,2005年与王珏移师南京大学主持举办了第 3 届研讨会,吸引了来自全国近 10个省市的 250余人参加。此次研讨会确定了会议“不征文、不收费”,所有报告均为邀请报告,以及“学术至上、其余从简”的办会宗旨,同时确定了 MLA举办时间为每年 11月上旬的周末。然而,个人的项目经费无法长期支持会议, 2006—2007年 MLA到了“生死关头”。经周志华竭力筹措, 2006年争取到南京航空航天大学信息科学与技术学院部分资助,2007年争取到南京师范大学数学与计算机学院部分资助,在两家兄弟单位的先后协助下,南京大学计算机软件新技术国家重点实验室顺利举办了第 4届和第 5届研讨会,每次均吸引了来自全国 10余个省市的约 300人参加。此后, 2008年举办第 6届研讨会适逢南京大学计算机学科建立 50周年,与会人数达到了 380余人;2009年

机器学习及其应用 2025 

和 2010年又在南京大学分别举办了第 7、第 8届研讨会,均有 400余人参加。这一时期是国内机器学习领域的“垦荒”阶段,众位今天的领域内耆宿如杨强、张长水、李航、封举富、于剑、陈松灿、郭天佑等为研讨会的持续举行以及我国机器学习学术共同体的发展作出了重要贡献。MLA在机器学习乃至国内计算机领域逐渐形成了重要影响,学界昵称其为“南京会议”。 

2011年至 2016年是 MLA的发展阶段。随着国内科研条件的改善,机器学习逐渐获得更多关注和支持。为进一步推动机器学习在国内的发展,从 2011年起, MLA的举办地开始走出南京。2011年和 2012年由张长水和杨强主持,清华大学自动化系、智能科学与系统国家重点实验室、清华大学信息科学与技术国家实验室(筹)举办了第 9届和第 10届研讨会,两次会议均有 500多人参加。2013年、2014年由张军平和高新波主持,分别在复旦大学计算机科学技术学院和上海市智能信息处理实验室举办了第 11届研讨会、在西安电子科技大学举办了第 12届研讨会,这两次会议分别有 600多人和 800多人参加。2015年和 2016年,研讨会再次回到南京大学举办,南京航空航天大学协办。此时国内机器学习研究和应用已经发展到一个新的高峰,这两次会议均有约 1400人参加。至此,研讨会已经成为备受国内机器学习及相关领域研究人员关注的盛会。

自 2017年起, MLA进入蓬勃阶段。2017年,第 15届研讨会由于剑主持,在北京交通大学举办、北京大学协办。2018年,第 16届研讨会在南京大学举行。这两届研讨会的参会人数都超过了预期,由此采取了预注册的方式,两次会议参会人数分别超过 1500人与 2000人。2019年,第 17届研讨会由胡清华主持,在天津大学主办,参会人数超过了 2200人。新冠疫情期间,研讨会不得不采用“线上 +线下”的方式举行。 2020年,第18届研讨会在南京大学举行,线下参会人数约 700人,线上参会人数约 4.5万人。 2021年,第 19届研讨会由南京航空航天大学举办,线下规模限制在 500人、线上参会人员累计超过 3万人。 2022年,第 20届研讨会全线上举行,累计参会人员 5.9万人。此后, 2023年第 21届研讨会在南京大学举行,参会人数超过 2000人;2024年,第 22届研讨会由中国科学技术大学在合肥举办,参会人数超过 2000人。最近这些年, MLA都只能在学校体育馆这样的场所举行,而现场参会人数则受限于场馆容量。

研讨会自发起之日起就受到了清华大学出版社的关注,研讨会主要组织者与清华大学出版社达成共识,每两年对研讨会上专家交流的部分技术内容,经过整理,结集成书,以飨读者。二十余年来,陆续出版了《机器学习及其应用》《机器学习及其应用: xx》

(xx 分别为 2009,2011,2013,2015,2017,2019,2021,2023),如果再算上 2004 年出版的《神经网络及其应用》,刚好十本。该系列书籍一定程度上展现了过去二十多年间我国机器学习领域从“跟跑”到“并跑领跑”的发展历程。感谢清华大学出版社!

本书是对第 21届和第 22 届 MLA研讨会交流内容的部分总结,共邀请了与会的9 位专家以综述的形式介绍机器学习不同分支及相关领域的研究进展。全书共分 9 章,涉及在线学习、多标记学习、强化学习、因果学习、自适应学习、大模型等,以及机器学习在城市计算、图像生成与检测、检索增强等方面的应用。

陈松灿教授等探究了缺失多标记学习中的全局高秩和局部低秩结构,并提出了一个统一的学习框架,解决了基于单视图、对比学习、多视图的缺失多标记学习三个典型问题。

侯臣平教授从特征变化和标签变化两个方面介绍了自适应环境变化的机器学习领域的最新进展,并对该领域的未来研究趋势和潜在应用场景进行了总结展望。

连德富教授从通用知识表征、学习向量索引和检索增强生成三个方面总结了大模型检索增强的最新进展。

王国胤教授等从计算智能、感知智能和认知智能三个层次,讨论分析了人工智能大模型所取得的技术突破和里程碑成果,以及当前发展中存在的局限性问题。

王楠楠教授等对深度图像生成与生成检测方法进行了总结,包括基于 GAN、 Transformer、Diffusion等模型的图像生成方法以及针对深度图像生成的检测方法,并展望了该领域的未来研究方向。

王天佐博士等梳理了面向隐变量场景的因果推断研究,针对隐变量带来结构不确定性由小到大的三种情况,介绍了基于局部因果关系融合的思路所提出的因果推断方法。

张伟楠教授等分析了当前强化学习关于策略表达性、复合误差、数据缺乏的问题,并系统讨论了基于扩散模型的强化学习方法在解决这几个问题方面的前沿科研进展。

赵鹏博士等针对流数据机器学习场景所面临的分布变化问题,提出了“在线集成”的理论框架,并针对不同信息反馈场景,构建了具有坚实理论保障的非稳态在线学习算法。

郑宇博士指出了管理和利用城市数据时面临的三大挑战,介绍了城市计算的理论框架,提出了城市知识体系和基于城市知识体系的数据要素构建方法,并转化为智能城市操作系统。

本书介绍了国内机器学习及其应用的一些最新研究进展,可供计算机、自动化、信

息处理及相关专业的研究人员、教师、研究生和工程技术人员参考,也可作为人工智能、

机器学习课程的辅助内容,希望对有志于从事机器学习研究的人员有所帮助。

这两届“机器学习及其应用”研讨会的举办及文集出版得到了“新一代人工智能国

家科技重大专项”项目( 2022ZD0114800)的支持。多位项目组成员参与了研讨会的组

织工作,并在会议期间介绍项目研究进展,特此致谢。

黎铭 白翔 王杰 刘淇 

2025年 7月 25日