从此走进深度人生 Deep net, deep life.

高晞:进入人工智能实验室的历史学者

作者:

在

2023年,《美国历史学评论》发表《作为历史学家的AI》一文,提出人工智能的学习机制与史学研究方法论上存在深层的结构性相似。学者由此开始认真思考一个切身的问题:史学工作者的专业判断与诠释能力,是否终将被人工智能所替代。三年以来,围绕人工智能究竟是史学研究的辅助工具,抑或历史知识生产的主体的争论,学术界的态度出现微妙的转向,越来越多的历史学者在实践中借助大语言模型及多模态人工智能技术,进行史料整理、文本比对、图像处理以及问题探索,尤其是在古文字学和考古学领域,人工智能与人文学者之间的合作已由工具使用迈入更为深度的协作阶段。2024年,由维也纳复杂性科学中心和牛津大学等国际机构参与的跨学科团队,利用塞萨特全球历史数据库(Seshat Global History Databank),建构了全球史学知识评测基准HiST⁃LLM,以回应学术界对“大语言模型在特定学科领域的知识储备与表现能力”的持续追问。研究团队使用该数据集对Gemini、OpenAI 和Llama 等7种主流大语言模型进行了测试,结果显示大语言模型对历史问题的理解与判断尚未达到人类专家水平。学术界也由最初的警惕和焦虑,逐步过渡到对“人机协同”模式的接受与尝试。但这一转向并未消解根本问题:当人工智能全面介入史学研究,它只是工具,还是可能在特定任务中表现出某种史学的推理能力,并由此形成“人工智能史学思维”?

当下学术界关于人工智能与史学关系的讨论多聚焦在“由数据、模型与推理机制构成的人工智能系统”与“人类历史学家”间的二元关系上,普遍忽略了这层关系中存在第三个关键角色:大模型或智能体的开发者,即科学家和技术工程师群体。作为“人工智能历史学家”的重要制造者,他们的学科背景、科学思维、问题意识以及他们的历史学认知,如何被内嵌到任务设计、数据组织、模型微调、提示结构与评测标准,影响或塑造“人工智能历史学家”的研究规则、学术边界和认知取向,这一问题关乎人工智能介入史学之后,历史知识生产主体和解释权力的分配,目前尚未得到充分讨论。

本文以历史学者进入人工智能实验室,深度参与史学专题模型建构的实践为线索,立足于多模态大模型、人工智能科学家与史学家之间形成的三重互动关系,通过解析实际案例,考察史学方法论如何在人工智能科学家与史学家的协作、碰撞与协商中被拆解、转译、重组与形式化;文章将此过程视为理解“人工智能史学思维”的切入点,进而讨论人工智能介入史学研究后形成的新型知识形态、方法结构以及知识权力问题。

一、进入实验室:史学逻辑的工程化转译

《作为历史学家的AI》一文从三个方面探讨了“人工智能”学习机制与史学研究流程的相关度:第一,“源数据的获取与选择”对应史料收集;第二,“通过神经网络实现的情境化”对应史料诠释;第三,“反向传播算法的经验性学习”对应史学修正。文章具体剖析了人工智能算法的每一步操作是如何以一种惊人的方式“实践”着史学方法的,作者努力说明人工智能将未经处理的数据转化为新的输出,与历史学家将原始材料转化为历史叙述,在逻辑上如出一辙。显然,作者是站在计算机思维的立场解构史学的认知结构,他所呈现的是人工智能学者理解的史学研究形态。那么,当史学工作者不再作为旁观者,而是直接介入人工智能史学模型的建构实验中,又会产生怎样的不同反应?

(一)从史学需求到工程实现:HistAgent的建构逻辑

2025年初,复旦大学历史学系团队与美国普林斯顿大学人工智能加速创新中心(AI for Accelerating Invention)团队合作研发了“AI Agent for History”项目,并于同年6月完成第一期任务。同年9月,复旦大学历史学系、复旦大学人工智能创新与产业研究院、上海科学智能研究院、上海创智学院联合研发“中华文明在西方”专题大模型。这两个项目的提出,均源自史学研究的现实需求。

第一个项目开发的初衷相当简单,困守于毕业论文写作的史学博士,一方面面对浩瀚的、高度碎片化的史料无从着手;另一方面却又陷于关键史料获取受限的局面,论文写作长期处于低效率与方法论的双重困境之中,而现有的通用人工智能工具难以提供有效的支持。相应地,人工智能工程师也察觉到,相较于日趋成熟的科学智能(AI for Science, AI4S) 领域,针对人文领域(AI for Humanities)特别是历史学科的专题智能体(AI for History)尚未引起人工智能科学家的关注。于是史学博士和人工智能博士一拍即合,设想通过设计智能体多元协作系统来提升史学研究的效率和精确度。

第二个项目是复旦大学 “早期中华文明多模态大模型”项目下的独立子项目,该项目覆盖考古学、文物、中国古代史、历史地理学、历史文献学、中国古典文献学、汉语言文字学、中国古代文学、中国少数民族语言文学等学科,整合甲骨金文、方志舆图等珍稀史料,目标是构建超大数据规模的早期中华文明知识体系。但是,何谓中华文明?如何定义中华文明?其本身就是一个高度历史化、随时代演进而被不断重新阐发的问题。作为一种文化形象,中华文明存在着两种相互并行的形态:一是在汉语语境下,经由历代积累而形成的自我叙事;二是在世界文明的历史长河与文明互动格局中,被域外世界不断建构、诠释的“他者”形象。这两种形象构成了中华文化知识结构的重要内涵。因此,要勾画出“中华文明”更为完整的历史图景亟须引入“他者”的视角,将非汉语史料和域外知识传统纳入视野。“中华文明在西方”模型的研发于是应运而生,目的是深化并完善原初的模型。

在这两个项目合作初期,史学团队担当了设计与整体规划的主导角色,史学问题意识始终贯穿其中。然而,当史学工作者真正介入人工智能实验的实践领地时,才弄清楚大语言模型的建构逻辑要服从工程化与科学化的规则体系,人工智能史学智能体的研究路径不会遵循史学的思维方式和研究节奏展开,而是要顺应史学逻辑工程化转译的要求。

首先,研发团队将这一面向史学研究的专用智能体命名为“HistAgent”,即AI Agent for History。与ChatGPT、DeepSeek、Gemini等以对话或知识生成为主要目标的通用大模型不同,HistAgent的研发初衷是构建一个有针对性地支持史学研究流程的垂直化平台。史学团队期望通过集成多语种史料处理、历史数据自动化整理与分析等功能,打造一个高效的协作环境,以简化史学研究日常工作流程并提升研究效率。HistAgent试图从底层架构出发,模拟历史学研究的实际工作流,设计目标在于最大限度满足史学工作者在研究中面临的多样化需求。通过对多种核心功能模块的整合,构建一个服务于史学研究的多模态系统。

为实现这一目标,该系统集成8个关键功能模块,包括文献搜索(接入多个学术网站和数据库)、光学字符识别(识别手稿、碑铭和古地图,支持西文手写体与部分亚洲文字)、多语种翻译、图像分析与检索(文物识别、图像反向检索)、音频处理(历史演讲和口述记录)、视频分析(影像材料)、文本网络检索模块(面向开放网络环境的历史信息检索)和文件处理与格式解析等。这些模块协同运作,使HistAgent 覆盖史学研究的多种任务,成为一个嵌入历史研究场景的人工智能助手。

在这个理想化的“史学研究工作流”架构中,承担核心调度和功能管控的并不是史学研究者,而是工程师设计并置于系统关键层级的中央调度模块,研发团队将其命名为“Manager Agent”(调度智能体)。该模块以“调度智能体”的方式操作多模态智能体协作系统,一方面将复杂任务拆解为不同的子任务,另一方面依据每个子任务的类型与需求调用上述最合适的专用智能体,从而组织起一个以中心调度为核心的多模块协作结构。史学研究流程被工程化地分解为6个步骤:任务界定—初步搜索(网络资料与数据库)—提炼修正—再次搜索—证据解析与核试—整合与输出。调度智能体的工作就是负责这个流程的协调与管理,这意味着史学研究的“程序”在很大程度上被预先写入了调度逻辑。

以下以一个具体图像识别任务为例,说明调度智能体的调度逻辑与执行路径,以便直观地呈现人工智能史学实验的全过程:

材料:提供PDF格式的画作文件

问题:这幅祭坛画中的男性人物是谁?

备选答案:(1)耶稣(Jesus),(2)圣·安东尼(Saint Anthony),(3)圣·弗朗西斯(Saint Francis),(4)圣·乔治(Saint George)

HistAgent的运作流程(由Manager Agent调度):

1. 图像分析启动,确定人物为圣·安东尼;

2. 网络页面初步搜索,确认上述信息;

3. 信息精确化:(1)该画原始信息,画像绘制时间、地点,(2)图像匹配度辨析,交叉引用并突出该文化产品详细的艺术作品特征和相关性,为确认该图像人物的答案提供支持证据;

4. 推理与逻辑分析:(1)界定该艺术品的用途,(2)资源溯源确认,(3)排除非相关因素,即其他几位人物,(4)最终推导结果,确定人物为圣·安东尼;

5. 输出和可信度分析:确认为圣·安东尼,并附带可信度等级、假设与限制条件、证据的充分性,以及可进一步改进的建议。

从方法论的角度考察,这套路径与史学研究的惯常逻辑存在着显著差异。智能体运行的第一步是任务界定,首先锁定最可能正确的答案,再组织证据加以确认;而史学研究通常经由史料广泛搜集与反复核实,去伪存真、辨析异同的过程逐步逼近史实,最终形成有据可查的历史判断。这不是简单的以论带史与论从史出之别,而是两种知识生产路径在认识论起点上的根本不同,体现了两种不同的路径——前者以推断为先,援引证据以验证假设;后者以史料为本,积证据之力而后立论。

当然,这种差异并非意味着工程化路径对史学全无裨益。值得关注的是,在由调度智能体主导的推理与逻辑分析环节中,引入了排除法,通过逐一排除备选项以锁定答案的算法推理模式,在常规史学论证中并不多见。这一切入点有助于拓宽史学工作者的视野,为研究者提供新的分析视角,甚至在某些情况下,能够启发研究者调整研究方向。这便是工程化转译给史学研究者带来的新体验。

(二)量化测评的困境:HistBench与史学原则的张力

如果说因为人工智能工程师是系统的实际建构者,史学研究流程的关键权力从研究者的判断与经验,一部分转移到工程师预设的调度系统及既有的算法逻辑,那么当工程师引入针对系统的基准测评时,史学团队并未意识到看似只是大模型或智能体建构中的一个技术环节,实际上蕴含了方法论上的机遇与认知层面的潜在危机。

项目进展到第二步,史学团队按技术团队要求制定一份基准评测框架(Benchmark)。在计算机领域,基准评测通常由标准化数据集、任务形式与评价指标共同构成,用以衡量模型或智能体系统在特定能力维度上的表现。21世纪以来,尤其是深度学习兴起之后,随着机器学习和统计方法的广泛应用,研究者愈发强调实验过程的可复现性与结果可比较性,基准评测逐渐演化成为一种制度化的实验装置,并在大模型研发与性能讨论中占据核心位置。简言之,基准评测框架就是针对特定能力设计的一套标准化、可反复施测的“试卷”,通过比较不同模型或系统在同一任务体系中的表现差异,判断模型和系统的优劣与局限。技术团队认为HistAgent应当纳入可验证的科学评估体系。通过测试其在史学研究场域的专业能力,为该智能体在技术体系中的有效性和正当性提供实验性依据。相应地,团队将这套基准测试体系命名为“HistBench”,以此作为比较“HistAgent”与现有通用大语言模型在史学专题研究中性能差异的重要工具,考察“HistAgent”是否具备学科专用模型的性能优势及其优势幅度,从而为这款“史学专业多模态智能体”的定位提供必要的论证基础。

史学团队是HistBench内容的设计者,评测的原则依循史学研究的实际路径制定,6个层层递进的评测维度分别对应考查6项核心能力:书目信息获取考查学术著作与期刊文章中的精准定位能力;史料识别考查手稿、档案、图像等史料的类型与来源判断能力;史料处理考查OCR转写、多语种翻译与技术性处理的准确度;历史分析考查证据约束下的因果解释、观念分析与制度比较能力;跨学科整合考查考古学、语言学、宗教学等邻近学科方法的引入能力;文化情境化考查隐喻、身份标识与特定历史语境的把握能力。

这套体系反映了当前史学方法的若干前沿取向,如全球史、跨国史、情感史、身体史和文化隐喻分析等多元研究路径,并体现了“跨学科整合”的学术共识。为确保题目的质量与这一定位相称,史学团队未采纳大多数人工智能基准评测惯用的算法自动生成或机器标注的出题策略,而是邀请资深史学教授、有海外学术背景的博士及研究助理协作出题,在题型、难度和广度等方面,力求真实反映当代史学研究的面貌,从而有效评测专业智能体或通用大模型的史学能力。

HistBench的题目覆盖29种古今语言(英语、汉语、俄语、日语、法语、德语、荷兰语等现代语言,以及拉丁语、古希腊语、藏语、叙利亚语、古维吾尔文、契丹文等一系列小语种与古文字),所涉材料类型包括:图像类资料(如插图、照片)、地图与示意图、统计图表、手稿与手写文书、铭刻与碑拓、音频材料、视频材料等。此外,还有图文混合型以及专门围绕古语言与死文字释读的题目。从学科领域来看,题库不仅涵盖政治史、社会史、文化史、思想史、环境史、经济与制度史、科学技术与医学史等至少36个专门史方向,也纳入了全球史、翻译史、宗教史与文明互涉等跨领域议题。在空间范围上,题目覆盖各大洲的人类文明区域,既包括东亚、欧洲、北美、拉美、中东与非洲等20余个区域或文明单元,也延伸至敦煌学、斯拉夫古文字学、西伯利亚民族志等具有高度专门化特征的领域。所有题目都经过多轮专家严格的交叉审校,以确保史学有效性和学术规范。

HistBench的规模与覆盖面固然体现了设计者的史学雄心,通过大量发掘英文之外的史料和史学研究状况,追求绘制历史知识的全球图景,并尝试突破既有的世界文明史书写范式,但这套自我测评机制与史学研究原则之间存在的张力难以回避。首先,大多数历史学者对量化评测抱有天然的抗拒和警惕态度,认为以固化的标准答案和量化方法评测史学研究的能力,在认识论上更接近于中学历史教育的应试逻辑,而非史学研究所强调的问题意识和阐释空间;其次,由于目前尚无可供参照的人工智能人文测评基准模板,HistBench不得不借鉴GAIA、Humanity’s Last Exam等前沿基准的题型结构,使自身的测试结果能够融入更广阔的国际评测视野,与学术界既有的评测体系接轨。HistBench采用两类题型:一类为精确匹配(exact match)题型,要求模型给出单一、精确的答案,如人名、地名、年代、术语或短语;另一类为多选(multiple choice)题型,在若干看似合理的选项中辨析出唯一正确答案。

这款史学专题模型的试卷,尽管在内容、方法论甚至问题意识上力图体现史学研究前沿,但其实际操作的逻辑不得不遵循AI for Science所确立的游戏规则,追求标准化、准确化、科学化与国际化,并没有创造出真正属于 AI for History 个性的评审原则。显然,在人工智能的实验中,史学设计者不自觉地滑入科学评测的语境,不得已地调整史学研究逻辑,放弃史学研究者所珍视的直觉、想象力、不确定性、反复无常的学术体验,以及对复杂历史现象的模糊性洞察,甚至学术审美的情感考量,这种妥协将史学研究引入“对与错”的二元叙事。事实上,这一现象颇具代表性,在已发表的人工智能史学论文中,已有相当一部分文章脱离史学语境而嵌入人工智能的技术话语体系,这一倾向令人担忧。

无疑,在HistAgent 语境中,史学工作者如何通过HistBench获得方法论的重构,使评测体系既满足人工智能史学实验的科学可检验性,又不至于背离史学学科的核心原则。这是史学与人工智能相结合所面临的新困境。

二、人工智能史学思维:工程化转译的认知形态

在进一步讨论之前,有必要对“人工智能史学思维”这一核心概念作基本梳理。目前中国学术界关于人工智能史学问题的讨论相当热烈,呈现出多元视角与多层次的解析,焦点多集中于“人工智能与历史学”的理论层面,如从语义学或语境角度思考人工智能模型在历史学研究中出现的“幻觉”问题,“量化史学”的新框架建构,以及可能引发的史学范式转移的讨论。但所有呈现的论文普遍停留在人机协同的实践路径、展示双向赋能的实验成果,并探讨新史学理论出现的可能性,尚未见到从认识论与系统结构层面对“人工智能史学思维”本身作出明确的界定。

本节所讨论的“人工智能史学思维”,是由上一节解析HistAgent智能体创制过程中延展出来的新议题。HistAgent的建构与运行表明,人工智能史学思维既不是机器自发产生的思维,也不是人类历史学家思维的简单投射,而是在史学方法论进入人工智能史学专题模型建构时,由工程逻辑拆解、重组与形式化后产生的复合认知形态。因此,本节将通过HistAgent的两个具体案例,分析史学问题如何在模型实验中被转化为可计算、可执行、可评测的任务结构,并由此考察“人工智能史学思维”的生成机制、认知特征、方法潜能及其引发的史学风险。

HistBench测试显示,人工智能系统在史学研究中的优势体现在三个方面:第一,对标准化、结构化书目与史料的检索,性能稳健;第二,能够有效完成单份或多份材料的技术处理,包括OCR识别、多语种翻译及关键信息提取;第三,在证据链条清晰、概念体系明确的中等深度分析任务中,能够生成具有一定参考价值的回答。所谓“人工智能赋能史学”,其意义正在于此,在学术文献检索、传统史料梳理与语言翻译、图像识别与对比、论文格式调整等前期研究与基础准备流程之中,人工智能可以显著提高研究效率,甚至在一定程度上部分替代史学工作者,完成重复性的工作,这便是吸引着越来越多的学者进入人工智能领域的重要原因。

由此,引申出一个新的核心问题,人工智能能否通过训练与学习,培养出“史学思维”,并进而成为历史知识生产的主体?这是当前史学工作者最为关切的现实议题。对此,无论是人工智能科学家还是深度参与人工智能史学实验的史学工作者普遍认为,现阶段尚不存在这种可能性。主持“早期中华文明多模态大模型”的技术团队负责人朱思语认为,当前大模型的核心支撑在于海量数据与强大算力,大模型虽已具备广泛的知识记忆能力,但考试能力与学科研究能力存在本质区别。在其他国际标准化评测中,比如MMLU中的历史任务带有鲜明的美国课程体系色彩,主要通过四选一选择题考查模型对美国高中历史课程及其相关教材化标准化历史知识的掌握情况。测试显示其历史知识水平的任务,GPT⁃4 Turbo 的准确率曾高达约95.8%,显示其在基础历史知识考试类任务上的强表现力。但当历史知识测评被拓展至“常识”范畴之外更深层的学术语境时,如前述基于塞萨特全球历史数据库的专业史学知识基准时,即使是当时表现最好的GPT⁃4 Turbo模型,其准确率也仅约为46%。研究者认为,一旦聚焦于研究生与学术层面的历史知识,“虽然大语言模型的表现优于随机猜测,但仍未达到专家级理解水平”。复旦大学与普林斯顿大学的HistBench测试亦证实,在涉及多学科视角与多重理论范式的综合权衡,在同时处理多语言材料中重构复杂语境、回应有争议的史学前沿问题,或是难以化约为单一标准答案等诸如此类多元复杂且无法给出确定答案的问题时,所有模型的准确率均出现系统性下降。

与此同时,更令人工智能工具使用者感到棘手的问题是,大语言模型在生成学术叙述时,不时会输出表面看似逻辑自洽却缺乏真实依据的结论,甚至虚构参考文献或证据以支撑其学术观点或史实判断,即所谓的人工智能“幻觉”(hallucination)现象,澳大利亚史学家沃林顿(Marnie Hughes⁃Warrington)称之为“机器历史学家”制造的产品。

若从实验的角度出发,深入到大语言模型系统架构层面,从内部看透“机器或人工智能历史学家”的思考轨迹或推理路径时,或许我们有可能理解“幻觉”之所以会产生的逻辑。下面以两个实际案例作出说明。

案例一:出自HistBench中的文物断代类题,要求根据提供的堆塑罐图像判断其生产朝代。

HistAgent的判断方法:第一步,通过图像分析智能体提取器物的视觉特征,并尝试利用文本网络检索智能体和文献检索智能体获取相关背景资料,结果系统未能检索到完整的学术文献。于是,系统转向内部知识库和克利夫兰艺术博物馆等权威外部来源进行比对分析。第二步,系统进入推理过程,依据风格特征逐一排除了装饰简朴的汉代,再根据器物装饰的叙事密集特点排除了东晋及以后的时期。第三步,结合该类器物的盛行期与西晋吻合,且权威来源明确标注其年代为西晋,最终系统将其判定为西晋器物。

HistAgent在评估中认为,通过图像分析、网络检索片段与权威标注的交叉验证,该答案具有较高的可靠性。但同时也指出,未能直接获取考古报告或学术论文是其研究的不足之处,并建议HistAgent未来应接入这一领域的专业学术数据库,以进一步增强鉴定的严谨性。

史学研究的断代方法:该题属于需整合器物形制、装饰风格、铭文信息与考古情境的多证据材料展开分析。史学鉴定的基本步骤:释读铭文、考据历史地理信息、分析器物造型与工艺的时代特征。此外,史学研究还需要结合出土情境与考古报告的交叉验证,形成基于实物、文本与考古背景的综合判断,方可断代。

AI与史学研究路径不同,但最终都得出了相同且正确的结论。

案例二:本题选自HistBench中的思想史类选择题,考查对洛克《政府论》写作背景与动机的理解。题目要求识别出推动洛克撰述该书的直接历史事件,答案选项:(1)捍卫光荣革命;(2)支持美国独立思想;(3)排斥法案危机;(4)质疑霍布斯的《利维坦》观点。

HistAgent的方法:首先通过文本网络检索智能体和文献检索智能体获取学术资讯,但因技术故障未能获得有效的外部信息,遂转而依靠其内部知识库进行推理。系统首先通过时间线索排除与《政府论》写作年代不符的“光荣革命”和“美国独立战争”;继而判断《利维坦》属于思想论辩范畴,而非直接的历史事件;最终,基于内部知识库思想史研究中的共识,系统认为“排斥法案危机”最符合《政府论》写作语境与政治动机,锁定答案为“排斥法案危机”。

第二则案例呈现出目前大语言模型时常会发生的一个问题,即调取资源时会发生故障。此次人工智能的解决方案是转而依赖内部知识库,再依据模型后台设计的推理范式,通过时间顺序比对、事件与文本表面关联性评估,最终基于内部存储的历史学共识选择答案。本案例测试的答案是正确的,但也有其他通用大模型在推理过程遭遇同样障碍时,不得不虚构数据,得出“幻觉”的结果,即输出了看似学术却错误的答案。

上述两个事例揭示了一个基本事实,人工智能在史学研究中的推理路径有其自身的内在逻辑。它的推理逻辑与人类历史学者的研究思维完全不同,但仍然可以得出与人类史学研究相同的结论,甚至是正确的答案。显然,人工智能的推理有其合理性。如果仅由结果去作评判,事实上,人类历史学者并没有充分理由否定人工智能所应用的方法和推理逻辑,更不能因为它简化了研究路径,没有遵循史学的论证传统,比如文本研读、人物分析和时代背景考察,而否定人工智能的史学研究能力及其研究成果的有效性。

三、走向协商:史学思维的嵌入与重构

“中华文明在西方”合作项目是一个由史学团队深度、全方位介入建构的史学专题模型。不同于仅接入单一数据库、以检索增强生成方式运行的专题智能体,该项目以专题大模型为基础,一方面尽可能汇集分散在世界各地与中国学研究相关的资源,另一方面着力发掘非英文的史料和小语种数据库,试图在非汉语知识体系中追溯始于16世纪西方语境中“中华”形象的生成与演变,从而重新界定“中华文明”在西方世界的历史概念。

基于此目标,团队同步规划了两个建立在同一专题大模型基础上的智能体:一个是多语种海外汉学与中国学资源的文献检索智能体,另一个是深度分析的专题智能体。两个智能体在语料遴选、网站主题分类、深度分析的思维框架等关键环节上,均由史学团队负责设计与把控。史学团队试图通过遴选、组织、标注和结构化那些长期被忽视或未被系统利用的多语种史料,将史学的方法论和问题意识融入专题大模型训练与智能体建构过程,创建一个非英语环境主导下的研究平台,使其在资料检索、史料解释和综合分析过程中尽可能呈现类史学的推理能力,从而更好地服务于史学研究的目标。

然而,史学思维一旦进入工程实现的环节,其主导权便在相当程度上移交给了技术团队。系统的结构如何搭建、各模块如何协调运作,技术路数如何设计,无不渗透着工程逻辑对史学意图的过滤与改写,技术团队由此成为知识产品不可忽视的共同形塑者。

再以具体案例加以说明。提示词:“白晋是清早期在华的耶稣会士,他对中国文化西传起到相当大的作用,请提供欧洲非英语体系中关于白晋的研究。”

深度分析专题智能体在执行网络学术搜索后,生成了一个结构完整的研究综述框架,按法、德、意大利和西班牙/葡萄牙语系,梳理各语系的重要学者、代表著作和研究重点,同时介绍了相关的学术机构、学术期刊和最新研究趋势。对研究者而言,大模型提供的材料相当丰富,仅依据其所提供的相关论文与数据库线索及其链接,就可以写出一篇关于欧洲非英文类白晋研究的学术综述。可见该模型在史料搜集与梳理方面的强大能力,能满足史学工作者前期研究的基本需求。其缺点在于信息略显宽泛庞杂,需要研究者对数据进行清洗。

令人意外的是,该模型的贡献并没有止步于史料的收集,它进一步展示其史学分析能力,归纳出非英文世界“研究主题(白晋)的跨语系共性”,归纳出4个主题:(1)索隐派神学研究;(2)科学技术史交流;(3)《易经》西传研究;(4)形象建构研究。最后,得出人工智能的史学结论:欧洲非英语体系对白晋的研究呈现出“法语主导、多语并进”的格局。法语研究最为系统,德语研究在哲学史方面深入,意大利语研究注重传教史脉络,伊比利亚语系研究则从殖民史角度提供独特视角。这些研究共同构成了对白晋的多维度学术认知。

这是不是一份“幻觉”的分析,尚待进一步核实,它得出的史学论断也有待商榷。在此,本文所要探讨的根本问题并不在于结论的真伪,而是要指出,我们所看到的这幅“历史”图景,其实是“算法工程师预先设定好参数后的映射”。这是因为,该深度智能体输出端所呈现的史学模式,本质上是技术团队按科学实验的工程逻辑预先设定的:先提出假设,再设计实验,继而逐步验证。严峻的现实在于, 在“中华文明在西方”的初代模型建构中,专业史学思维的介入相对有限,其内在的史学逻辑是依据工程师们的学科知识背景、科学式的学术惯性和问题意识,以及在他们的历史学认知基础上塑造而成的。在第二代模型建构过程中,史学团队试图将史学思维经由技术团队转译并嵌入训练数据构造、提示结构、任务流程、工具调用和评测标准之中。然而,这一过程始终面临话语体系不对称的结构性障碍,史学话语与技术话语之间存在难以弥补的认知鸿沟,而塑造人工智能史学思维的技术话语权,实际掌握在人工智能工程师手中。

以工程化逻辑主导的史学模型所生成的知识产品,虽然隐含了科学家的思维逻辑,但并非全无参考价值。在“白晋研究”的诸议题上,模型自主拓展生成的“跨语系共性”分析和归纳,在现有相关研究中尚属罕见,这样的学术结果对历史学家推进这一课题,仍不失为具有参照价值的学术起点。这喻示着,在史学团队与技术团队的协商下,史学专题模型初显某种独立的史学问题意识和比较研究视野。

于是,亟须对“人工智能史学思维”进行重新界定。首先,该思维在本质上呈现为“数据高维空间思维”,它重塑了传统史学的时间性和空间性。依托大模型数亿文本图像参数空间,通过概率计算寻找史料特征之间的最高频且最可能关联,比如第一则案例中器物标签匹配,而无需真正实现对史学主体的认知与理解;第二则案例的时间线排除法,不需要真正“理解”洛克是谁。其次,该思维具有“去主体化”特征,“白晋”案例揭示出的所谓人工智能史学思维,并非人机协作的产物,而是“历史学家的问题意识+人工智能科学家的工程算法+海量多语种预训练语料”,三者异质碰撞后产生的新的“无主体的推理网络思维”。在此过程中,技术话语权虽然归属工程师,但其形成的认知形态已超越单一主体的任何一方。再次,体现在方法论互补性价值,即“跨语系共性”的特征,“白晋”研究所涌现的4个有启发性的主题,正是人工智能史学思维通过海量多语种文献的相关聚类(Clustering)直接表征,其展现出的史料编织与互证能力,构成了对传统个体历史学者研究的有力互补。最后,面临追求答案的正确率而制造史学幻觉的潜在风险,受限于机器算法机制及预训语料不完备性,人工智能可能诱发虚构证据、伪造文献,错误归因和解释过度等偏差。这类由“幻觉史料”制造的“虚假的历史事件”,一旦被研究者误用,由此生产出史学论文,将导致“伪史”进入学术循环,污染既有史料库,从而引发历史修正主义的危机。

尽管史学专题模型产生的人工智能史学思维有着诸多潜在的优势,但若要求人工智能遵循史学传统或模拟人类学者的思维逻辑,如深入文本细节与历史语境,对时代环境、政治环境作微观考察,作出深度的史学阐释;或对历史人物的心理或性格作深度分析,展现人类史学家“同情之理解”的史学境界,目前现有的大语言智能体及基于其构建的史学智能体尚未达到这一认知境界,其对历史解释的丰富性和专业性仍逊色于人类专家。HistBench的测试显示了人工智能史学研究的边界,无论是铭文解读、地理考证、器物关联还是考古情境的综合分析,现有大语言模型或专用智能体的处理方法仍停留在特征匹配与标签对应层面,难以承担深度解释的责任。

在专题研究层面,史学智能体虽有强大的数据库和高效的检索能力可作为研究依托,但在知识密度和思维深度上依然难以企及资深史学家。史学家的研究能力建立在系统的史学训练、长时期的史料爬梳以及持续关注史学前沿动态之上,兼具理论素养与多种语言能力,由此形成问题意识、分析能力和批判性思维,是当前人工智能模型难以复现的核心优势。

值得重视的是:多数人类研究者同样难以达到其对人工智能史学智能体所提出的严苛标准。正是在这一意义上,人工智能方法论上的独特价值逐渐显现出来:它能够在人机协同中形成一种基于提示、核验与修正的迭代反馈机制。在与史学家的反复提示、修正与对话中,人工智能模型或专题智能体能够在当前任务流程内持续调整回答路径和分析重点,并在后续训练或系统迭代中进一步转化为可固化的能力,输出超越常规史学思维的观察角度与历史推理或史学解释,从而启发研究者的问题意识,拓展分析维度。

近半年来,随着各类人工智能工具相继进入研究实践,史学工作者已在人机协作时领略到偶发的认知互补,这种在效果上类似人类历史学家的灵感突现,正在悄然拓展史学研究的边界。国际学术界已有学者尝试用双重比较手段,探讨了传统历史研究方法与生成式人工智能工具在古代历史原始资料的识别、解读和验证方面的不同表现,评估每种方法在认识上的优势与局限。

“中华文明在西方”大模型已迭代至第三代,其运作路径已由最初的“假设—实验—验证”的工程流程,转换为“问题拆解—资料收集—信息核查—撰写报告”的四步史学路径,正尝试将史学思维嵌入大模型建构的前端,探索人工智能史学思维的可能性,比如建构历史人物的四级关系网络结构,嵌入模型;强调信息核查以捕捉和拦截“幻觉”。2025年法国艾克斯—马赛大学的亨利奥(Christian Henrio)与中国台湾学者合作,以6位中国商人研究为案例,编写了一篇如何将大语言模型整合进历史研究工作流程的指南,其将研究流程划分为9个步骤,覆盖从研究问题的提出、到成果传播,以及可重复性的完整研究周期。2025年发布的“孔子数智大模型”,便是由大连科技大学和北京大学学者联合设计的一个专门为历史分析设计的大语言模型。通过整合精挑细选的高质量历史数据以及一种新颖的事实强化学习策略,展现人工智能研究方法带来的事实对齐能力和深度的推理水平。2026年牛津大学工程科学系和经济与社会史中心联合推出一款称为人工智能历史学家(AI Historian)的智能体,可供历史研究者直接用于处理史料。这标志着史学研究者以“实验者”的身份,全面介入人工智能研究的方法论层面。

结论

具有强大推理能力的大语言模型和多模态智能体,能否在实验室情景中产生“新思想”和“新方法”?这并非一个全新的话题。事实上,早在17世纪,“思想与知识是否可以通过实验去理解或生产”这一命题,就在欧洲自然哲学家群体中间引发过激烈的争论。17世纪60年代,英国自然哲学家波义耳(Robert Boyle,1627⁃1691)和政治家霍布斯(Thomas Hobbes,1588⁃1679)之间发生过一场著名的辩论,核心议题为“实验是否能够产生知识或被承认为知识形式”。波义耳是实验科学的倡导者和实践者,他主张实验是一种系统化自然知识的方法,实验所得“事实”可以成为科学知识的基础,而霍布斯对此持质疑态度,主张自然知识必须建立在理性演绎和确定性之上。需要指出的是,在17世纪的语境中,自然知识(natural knowledge)并不等于今日意义上的自然科学,而是一个更为宽广的知识体系,涉及哲学、自然科学、神学乃至政治体制的正当性,它是一个人类知识的集合体。1663年波义耳在长期从事炼金术实践和化学实验的基础上,撰写了《论实验自然哲学之有用性》一书,试图沿着回溯西方自然哲学史和医学思想史的路径,论证实验知识的公共性、不确定性和可验证性。与此同时,他还从生理实验和经验角度探讨人脑思维(人类心智活动),进而通过自然实验将阐释上帝、心灵与道德等终极问题联系起来。1660年,在波义耳等人的推动下,英国皇家自然知识促进会(Royal Society of London for Improving Natural Knowledge, 简称英国皇家学会)成立,在实验科学的思想主导下,对自然知识的研究逐渐从传统的自然哲学框架下分化出来。经过约二百年的演变,自然科学、哲学和思想形成了相对独立的知识领域,相应地,孕育出科学家、哲学家和思想家等不同知识角色。这一历史进程为我们反思史学研究者的焦虑提供了重要的思想史参照。

由此可见,“人工智能体能否产生新思想”的设问,不是在人工智能时代的新问题,而是一个延续了数百年的经典问题在当代语境的变体。需要说明的是,大语言模型与17世纪意义上的自然哲学实验,在方法论层面有着本质差异。实验科学讨论的是特定物理环境下的发现,能否导向对自然世界具有一般效力的知识;而当前以大语言模型为核心的人工智能体,其运作主要依托对文本及多模态数据表征的概率建模与生成,并非建立在对物理世界的直接理解之上。

本文以历史学者亲身参与人工智能史学专题模型建构的实验经历为线索,考察了史学逻辑在工程化转译过程中的遭遇与变形,并尝试对“人工智能史学思维”这一新兴认知形态作出初步界定。实验表明,历史学者进入人工智能实验室,并未如想象中能直接将史学方法论“输入”模型,相反,史学知识必须经过与工程逻辑的持续碰撞和反复协商,才可能被纳入模型建构过程,共同塑造一种尚在生成之中的新型知识形态,该形态并不具备类似人类历史学家的主体意识。在此次实践体验中,归纳出以下几点想法。

第一,人工智能史学思维的形成,有赖于历史学者在模型设计、语料遴选、训练数据构造、智能体流程设计与评测机制中的深度介入和持续塑造,建立反馈机制,以便修正模型的认知偏差,降低“幻觉”出现的概率。

第二,经技术团队工程化的人工智能史学思维或逻辑推理,虽然在路径上迥异于史学传统的论证模式,但并非完全不足取,其中如排除法、图像类比分析法、实体关系抽取与关系网络分析等,为史学研究者创造新的参照与反思契机。

第三,在历史学者与工程师的协同实践下,人工智能史学思维的生成正在为史学研究开辟新的空间,它不仅可以挑战以英文史料为主导的全球知识分布不平衡,也将在一定程度上突破既有的世界文明史书写范式,为史学范式的转型甚至潜在的深层变革提供新的可能。

第四,警惕对人工智能史学模型的过度依赖,以免侵蚀史学训练的学术根基。新一代学生正在人工智能史学思维训练下成长,传统史学赖以立身的史料批判与考辨规训,正面临被大模型建构的数字化“捷径”替代的风险。

第五,作为尚在形成中的新型认知形态,人工智能史学思维是一个新事物,不宜简单地按人类的思维尺度加以裁量;相反,这一新事物有可能反作用于人类认知方式,对史学理解与研究产生难以预估的深远影响。

2025年以来,国际学术界围绕“人工智能史学思维”的讨论正经历明显的演进。2026年6月卢森堡“AI through History, History through AI”国际学术研讨会,折射出这一演进的轨迹:从最初本课题组提出的“AI for History”(人工智能赋能史学),到探讨“AI plus History”(人工智能与历史学双向赋能),再进展到研究“AI through History / History through AI”(人工智能中的史学与史学中的人工智能)。每一次表述的迭代,都意味着学术界通过实验或实践对这一关系的理解在不断深化。在此次会议上,已有欧洲学者将目光投向与本文旨趣相近的前沿话题,表明这一思考方向正在引起国际学术界的广泛关注。当前,国内外学术界正在寻找人工智能与史学真正意义上的交汇点。一种新的知识形态呼之欲出,它尚待命名,尚待界定,却已不可阻挡。

转自《中国社会科学》2026年第8期

评论

发表回复