数字细读:对科幻文学的计算批评之路

分类  : 中文
作者  : 刘洋
来源  : 现代中文学刊
卷   : 2023 年第 6 期 总第 87 期
发表时间: 2023.12.18.
发布人 : ChinaSF

摘要:

计算批评是一种融合了定量计算和阐释批评的文学研究范式,它的目标是让计算直面情节叙事、艺术风格等高层次的文学问题,这其中,数字细读是必不可少的方法。数字细读通过将阅读媒介从传统细读的文学文本和他人研究扩展到指标、图像、数据和算法等方面,可以有效地提升量化指标的合理性,在数据和文学意义之间建立关联,发现文本中的隐藏结构和趋势,并最终服务于高层文学概念的建模分析。科幻文学作为当前中国备受关注的一个重要文学类型,对其进行的计算批评研究可以帮助我们从整体上了解这一文类的发展现状和趋势,发现其自身所隐藏的结构性特征,也有助于研究者了解、熟悉和改进数字细读这一新的文学研究范式。


正文:

  文学计算(LiteraryComputing),即通过计量的方式进行文学作品的挖掘、分析、比较和批评,是当前方兴未艾的数字人文潮流中的一个重要组成部分,但其传统和源流又远远早于数字人文这一概念所通常涵盖的时间范围。大致来看,我们可以将文学计算的发展历程分为三个阶段。从19世纪中叶到20世纪中叶是萌芽阶段,门登霍尔(Mendenhall)1、尤尔(Yule)2等物理学、数学等领域的研究者,将一些理工科的概念和研究方式引入到对文学作品的研究中来,通过人工计数的方式对句长、词频、词长等微观特征量进行了统计分析,试图寻找到作家风格和计量特征之间的确切关联。在20世纪下半叶,随着计算机的发明和广泛应用,文学计算进入到一个新的发展阶段。通过计算机对文本的自动化读取和统计,文学计算的语料库和数据规模迅速扩大,主成分分析3、Delta分数4、文本聚类5等各种层出不穷的多变量方法也被提出和应用到研究中来,很大程度上克服了单一的微观指标所存在的局限性,提高了风格计量的有效性。这一阶段的研究者以计算机和语言学领域的学者为主,如莫顿(Morton)、布雷纳德(Brainerd)、伯罗斯(Burrows)等。进入21世纪以后,文学计算领域的面貌又发生了全新的变化。角色网络分析6、情感计算7等新的文本挖掘的路径,超越了传统的基于词频的低层次建模方式,让情节、叙事等更高层次的特征对象有了量化分析的可能。在国内,也有越来越多的人文学者通过计量方法来处理文学问题,比如赵薇对小说《大波》三部曲中角色网络的提取8、吉云飞对网络小说节奏和情绪的分析9等。

  但是,纵观文学计算的发展史,我们不难发现,这类量化研究论文很少发表在传统的文学研究期刊上,这意味着文学计算仍然处于广泛的文学研究领域的边缘地位。这其中,固然有传统的学科壁垒所带来的分歧和偏见,但部分文学计算研究聚焦于算法、数据结构或某些技术细节之中,缺少对真正的文学问题和具体文学作品的关注和分析,也是其无法融入传统的阐释批评潮流的重要原因。

  近年来,以莫莱蒂(Moretti)《远读》10为代表的数字人文新浪潮开始强调从技术到文本的回归。不同于物理学学者只是将文本作为一种复杂系统而进行的整体性研究,不同于计算机学者为了构造一类通用型文字处理算法而进行的技术开发,也不同于计量语言学家全然依据语法和文类而展开的分析,回归文本的文学计算应该以算法和量化指标为基础,帮助我们更加深入地在作品的文学语言、情节叙事、象征隐喻、风格建构、艺术审美等更高层次对文学作品进行建模分析,从而走向一种以计算为手段的文学批评和诗性观照。这就是所谓的“计算批评”(ComputationalCriticism)11,或者说“算法批评”(AlgorithmicCriticism)12、“数字批评”(DigitalCriticism)13。这是一种融合了定量计算与阐释批评的文学研究范式,在当前的数字文化时代,其不仅是对传统文学批评在方法上的一种扩展和补充,而且也有望逐渐成为未来文学研究的主流方向之一。

  计算批评要求数字人文学者超越对于数字技术的盲从,在深刻了解算法流程和数学模型本身局限性的基础上,将数据中的显著模式和奇异特征与文本细读结合起来,对计算结果背后所隐藏的文学机制进行猜想,并随即通过对算法和建模进行的灵活调整以检验这种理论猜想,从而完成“‘数据→模型→细读→理论→数据→……’的阐释循环”。14也就是说,研究过程中,人们需要审视的不仅是运算结果,而且还要包括数据噪音、算法机制、量化指标、意义建模等众多环节。换言之,我们可以将其称为一种新的“细读”,只不过将细读的媒介从传统的小说文本和他人研究,扩展到数据、算法、指标和建模的层面上了。有学者将后者称为“中层阅读媒介”,认为数字人文研究者“通过中层阅读媒介所反馈的信息,去查看底层‘原始材料’中为何会出现离群值,或调整阅读媒介,或调整假设,最终产生有价值的文学批评”。15我认为不妨将其称为“数字细读”,以区别于传统的文本细读。在通往“计算批评”的路径上,数字细读是必不可少的核心环节。

  本文将结合笔者对科幻文学的一些实证研究经验,谈谈计算批评的基本实践路径,以及在这个过程中需要从哪些方面进行数字细读。

  一、语料库的建设与预处理与传统的基于阐释的文本细读研究相比,文学计算通常将自己的研究对象扩展到数量庞大的文本集群中,通过统一的量化指标在不同文本间建立比较和整合的通道,从而能够在超越单一作品和单一作者的层面上获得新的洞见。因此,根据自己的研究目标,建构一个系统全面的文本语料库,便成为了此类研究最重要的前期工作之一。

  早在公元9世纪,阿拉伯哲学家铿迪(al–Kindī)在讨论关于密码分析的定量方法时,曾提出了一个巧妙的想法,即可以通过统计文本中各字母出现的频率,从而在明文和密文之间建立起关联。与此同时,他还提出了一个很重要的前提条件,即拿到的密文长度要足够长,以便使对字母的计量数据具有统计学意义。16这一想法是极具原创性和启发性的。直到今天,我们在很多关于作者判定的文学计算研究中,语料库的长度对判定准确度的影响,仍然是一个极为重要的问题。1987年,复旦大学李贤平教授通过虚词作为特征向量进行文本聚类,对《红楼梦》的作者问题进行了研究,认为其是由多个作者在不同时期撰写而成的。17然而,施建军对李贤平所用的聚类方法进行了细致的剖析,认为只用《红楼梦》的120回作为样本所进行的聚类分析不能够为作者鉴定提供可靠的证据。18可见,对于作者判定和计量风格分析来说,语料库的长度是很重要的。虽然近年来出现了一些针对小语料库的所谓“微归属”(microattribution)方法,但有研究指出其并不值得信赖。19语料库构建的第一步是选择需要的作品,然后通过扫描识别的方式将其转换为电子文本。当然,很多作品本身已经在网络上以电子书的形式发行和出版,因此可以跳过实体书直接获取到它的数字文档。在英语文学领域,有一个著名的古腾堡项目(ProjectGutenberg),其中收录了7万余本免费的英文电子书,主要是版权过期的文学作品,研究者可以很方便地获取所需的文本。在中文领域,目前还没有如此大规模的免费数据库。就科幻文学来说,目前有一个较为全面的检索型数据库,即中文科幻数据库(CSFDB,ChineseScienceFictionDatabase),20但目前尚未提供全文下载服务。


试阅到此结束,如需查看全部内容请购买正版文献。如因学习需要阅览全文,请联系站长。