自然语言处理是计算机科学和人工智能领域中的一个关键研究方向,致力于研究能实现人与计算机之间用自然语言(如英语、中文等)进行有效通信的各种理论和方法。其目标可以归纳为语言理解、语言生成和人机交互:语言理解使计算机准确把握词汇的精确含义、句子结构以及整个文本的上下文和意图;语言生成让计算机产出自然流畅的人类语言,用于回应、解释或传达信息;人机交互则实现人与计算机之间自然、流畅的交互,提升用户体验和服务效率。该领域研究涉及计算机科学、语言学、心理学和统计学等多个学科。
理解这一概念,需要抓住三个要点。其一,通信媒介是自然语言,而不是机器指令。其二,三大目标相互衔接:先理解含义与意图,再生成自然流畅的语言,最终实现自然的人机交互。其三,它是计算机科学、语言学、心理学和统计学交叉支撑的研究方向。因此,其核心不是“让计算机显示文字”,而是让人与计算机能够用日常语言有效通信。
按照课程划分,发展历程依次为四个阶段。早期探索期(1950—60年代)以符号学派和随机学派为代表,主要集中在基础理论和模式识别等方面。理性主义时代(1970—80年代),基于逻辑的范式、基于规则的范式和随机范式得到广泛研究和应用。经验主义时代(1990年代至2000年代),基于机器学习和大量数据的方法开始占据主导地位。深度学习时代和大模型时代(2010年代至今),深度神经网络,特别是循环神经网络(RNN)和Transformer架构,带来了前所未有的模型性能。
智能聊天机器人可随时回答咨询并提供个性化服务,智能搜索引擎能理解查询意图,自动摘要与文本生成正在改变新闻、出版行业;教育领域可用于作业批改与个性化学习建议,医疗健康领域则通过分析病历文书辅助诊断。把握概念、三大目标与四阶段发展脉络,是后续学习语言学基础、基础任务与常见应用的前提。