摘要
中国大陆近二十年的跨性别历史留下了大量数字原生材料:国家医疗规范以政府网页和附件发布,社群调查常以 PDF 流通,医院以新闻页记录团队成立,法律倡议者把案件整理成专题网页,数字档案又为迁移过的文件补充作者、年份、原始链接、文件大小与校验值。进入人工智能辅助检索与文本分析逐渐成为日常研究方法的二〇二六年,同一份史料的“可见”状态可以拆成更具体的技术层:页面是否提供明确对象身份,正文是否拥有可解析文本层,标题与章节是否形成结构锚点,原始来源关系是否明示,文件是否具有稳定标识,外部系统是否拥有可解析的发现入口。
本文选择十二组公开史料作为固定样本,覆盖二〇〇九年国家“变性手术”技术规范、二〇一六年全国 LGBTI 调查、二〇一七年全国跨性别调查与校园/证件报告、二〇一八年法律性别承认评估与北医三院团队页面、二〇一九年证件修改手册与国际特赦组织医疗报告、二〇二一年全国跨性别健康调研、二〇二二年 G05 性别重置技术规范,以及法律与社区档案镜像。观察对象是这些材料在二〇二六年公开网络上暴露给研究者、搜索引擎和文本工具的入口形式,研究重点落在文档基础设施与证据接口。
文章提出机器可读证据梯:对象身份 → 可解析正文 → 结构锚点 → 来源关系 → 文件身份 → 冗余发现入口。六层分别回答“这是什么”“文本在哪里”“章节怎样定位”“它从哪里来”“这一份文件是哪一版”“还有哪些入口能抵达同一对象”。文章进一步提出AI 发现债务,用于描述一份史料在进入检索、抽取、比对和引用工作流之前仍需补齐的转换工作。只有文件链接的页面需要先恢复对象元数据;只有图像的材料需要文本识别;只有自动摘要的档案记录需要回到原文校核;拥有 HTML 落地页、文本层、稳定文件链接和明确来源关系的对象则拥有较低的发现债务。
固定样本显示,中国大陆跨性别数字史料已经形成多种互补接口。政府 HTML 提供制度来源与发布日期,机构落地页连接多语言 PDF,社群档案为历史文件增加文件级元数据与原始链接,专题法律站把长规范转写成可定位的网页结构。PDF 继续承担页码、版式和可引用图表的保存任务;HTML 与档案元数据承担发现、定位和来源连接任务。面向 AI 的历史基础设施因此可以围绕“同一对象的多种表现形式”建设:保存原文件,同时维护机器可读的对象身份、文本层、结构和来源关系。
关键词: 中国大陆跨性别历史;机器可读性;PDF;数字档案;人工智能;信息检索;来源学;数字保存
1. 研究问题:从“网页还在”推进到“机器怎样读到它”
数字史研究已经把网址失效、网页版本、网络档案和检索入口视为历史方法的一部分。Klein 等人对学术链接的研究说明引用对象会经历 reference rot;Jones 等人进一步展示网址仍然响应时,内容本身也可能发生漂移;Memento 体系则把原始 URL 与时间化存档版本连接起来(Klein et al. 2014; Jones et al. 2016; Sanderson et al. 2011)。GenderLibs 在九月一日的数字保存观察中据此提出“source-survival stack”,强调原始发布、同期副本、社群档案、通用网页档案、发现索引与学术引用之间的连续链条。
今天的问题向文档内部再推进一层。一个历史对象可以拥有稳定网址,同时以多种形态存在:纯 HTML 正文、HTML 落地页加 PDF、独立 PDF、档案元数据页加原文件、经过重新排版的专题网页。研究者可以通过浏览器阅读这些材料;搜索引擎、语料工具与生成式 AI 则需要把页面转换为标题、正文、章节、表格、链接、文件身份与来源关系。Lara Putnam 对“text-searchable”数字史料的讨论指出,全文检索会重新塑造研究者能够提出的问题与跨地域连接方式;档案与 AI 研究进一步显示,自动抽取的能力与原始材料的组织、描述和访问接口紧密相连(Putnam 2016; Colavizza et al. 2022)。
因此,本文研究的核心问题是:二〇二六年公开网络上的中国大陆跨性别历史材料,为机器检索与 AI 辅助研究提供了哪些可读接口?不同文档形态分别保存了哪些历史价值?研究者怎样记录这些接口,才能让抽取结果保持来源可追溯?
中心判断是:机器可读性是一组分层属性。文本层提供词语与句子的入口,结构层提供章节与表格定位,来源层提供对象之间的历史关系,文件层提供版本与同一性线索,发现层提供从查询到对象的路径。高质量数字史料基础设施把这些属性连接起来,让人类阅读、搜索索引、自动抽取与严谨引用共享同一套来源坐标。
2. 研究材料与方法:固定样本与六层观察
本文观察日期为二〇二六年九月十五日。样本选择遵循三个条件:对象与中国大陆跨性别历史直接相关;材料在公共网络上具有可解析入口;对象横跨政策、调查、医疗机构、法律倡议与社群知识,从而可以比较不同发布传统。十二组样本分别来自国家卫生主管部门、UNDP、中国发展简报、北医三院、国际特赦组织、CNLGBTDATA、跨与多元性别档案、Project Trans 与同语法律档案。
观察只记录公开界面能够证明的技术事实。比如,UNDP 的二〇一六年调查落地页同时显示标题、日期、实施机构、摘要和下载入口,并提供中英文 PDF;国际特赦组织二〇一九年报告拥有报告落地页、语言切换和 PDF,PDF 本身可抽取目录与正文文本;跨与多元性别档案的二〇一七调查记录提供文件名、格式、大小、MD5、归档时间、原始链接、作者、地区、年份与标签(UNDP 2016; Amnesty International 2019a; Chinese Transgender Digital Archive 2026a)。这些字段直接进入观察表。
本文把机器可读性拆成六层:
| 层级 | 观察字段 | 历史研究价值 |
|---|---|---|
| 对象身份 | title、publisher/author、date、document number | 确定引用对象与制度主体 |
| 可解析正文 | HTML 正文、PDF 文本层、可抽取段落 | 支持全文检索、引用定位和语料分析 |
| 结构锚点 | headings、目录、表格、页码、章节标签 | 支持段落级定位与章节比较 |
| 来源关系 | original link、mirror relation、archive note | 区分原始发布、镜像、档案与再描述 |
| 文件身份 | filename、format、size、hash、version | 识别文件版本与重复副本 |
| 冗余发现入口 | institutional page、archive page、legal mirror、catalog | 让同一对象从多种查询路径进入研究流程 |
这种分层方法与历史文档识别研究形成呼应。OCR 和 post-OCR 研究关注从图像恢复字符与修订识别误差;历史文档 NER 关注从文本中提取人名、机构、地点和日期;数字档案研究关注机器学习进入馆藏描述、发现与访问后产生的新工作流(Nguyen et al. 2021; Ehrmann et al. 2023; Muehlberger et al. 2019; Colavizza et al. 2022)。本文把这些技术问题放回一组具体的中文跨性别史料中,观察发布方式如何影响后续检索与证据链。
3. HTML 作为“对象身份页”:二〇〇九国家规范与二〇一八医院记录
二〇〇九年《变性手术技术管理规范(试行)》在国家卫生主管部门页面上保留制度来源、发布时间和正式文本入口;Project Trans 又把同一规范整理为标题、章节和逐条正文都可定位的专题网页(Ministry of Health 2009; Project Trans 2026a)。两类页面承担不同角色。政府页面提供权威发布上下文,专题法律页提供更加稳定的段落结构和同主题时间线入口。研究者把二者并列记录后,可以同时保有制度出处与检索便利。
HTML 的优势来自对象身份和正文处在同一页面结构中。页面标题可以进入搜索索引,正文段落可以被全文检索,章节标题可以成为语义锚点,链接则把当前规范接回上级通知或后续版本。Putnam 对可全文检索材料的分析强调,数字化使研究从目录层的发现推进到文本内部的跨文档连接;这类连接尤其适合政策术语史,因为“变性手术”“性别重置技术”“易性症”“性别不一致”等词语可以按版本定位(Putnam 2016)。
二〇一八年北医三院“易性症序列医疗团队成立”页面提供另一种 HTML 历史对象。网页保留发布日期、医院科室来源、标题和连续正文,并列出团队覆盖的心理、内分泌、男科、整形外科等诊疗环节(PUH3 Department of Plastic Surgery 2018)。它的历史价值来自机构自述:研究者能够知道医院在某个具体日期怎样命名团队、怎样描述服务范围。页面结构也让文本工具直接提取日期、机构与医疗项目,之后再与国家规范或学术研究对照。
因此,“HTML”本身仍需附带来源角色。政府通知、医院新闻、法律镜像都使用 HTML,但它们分别代表权威发布、机构历史记录与专题重排。机器可读证据梯中的“来源关系”一层负责保存这种差异。自动抽取可以把三者转成文本;历史研究需要继续保留谁发布、何时发布、为何存在这一页面。
4. “落地页 + PDF”形成双层接口:UNDP 二〇一六与二〇一八报告
UNDP 的二〇一六年 Being LGBTI in China 为双层接口提供清晰实例。公开落地页显示报告名称、二〇一六年五月十六日的发布日期、调查范围、实施机构,并把用户导向下载材料;同一项目的亚太页面还明确列出英文与中文 PDF 文件(UNDP 2016)。落地页适合搜索引擎抓取对象身份和摘要,PDF 则保存完整报告、页码、图表与版式。
二〇一八年 Legal Gender Recognition in China: A Legal and Policy Review 使用相似结构。UNDP 页面在正文之前直接列出英文 PDF 和中文 PDF,并保留发布日期、报告目的与区域项目背景;同期新闻稿又记录发布活动、合作机构和现场发言(UNDP 2018a, 2018b)。对于研究者而言,报告页面、PDF 与新闻稿构成三种证据:对象级元数据、正式长文档和事件级发布语境。
这一结构特别适合 AI 辅助研究。对象识别可以从 HTML 读取标题、日期和摘要,全文分析可以转到 PDF 文本层,页码继续支持传统引用。Westergaard 等人比较摘要与全文文本挖掘后显示,全文提供远多于摘要的关系与术语证据;Starr 等人关于人机可访问引用数据的讨论则强调标识、定位和机器可达性对复用的重要性(Westergaard et al. 2018; Starr et al. 2015)。落地页与 PDF 的组合把“发现”和“深读”分配给两个互补对象。
PDF 的视觉稳定性同样构成史料价值。表格布局、章节分页、图注、问卷附录和双语排版都可能承载历史信息。数字史工作因此适合保存 PDF 原件,并为其增加一个更容易索引的 HTML 对象身份页。这样的接口设计让版式证据和机器检索共同存在。
5. 二〇一七调查:发布页、下载文件与档案元数据形成三层对象
二〇一七年全国跨性别调查在当前公共网络上拥有多种入口。中国发展简报的发布报道保留标题、来源、作者、日期和下载入口,同时描述调查发布活动;另一个出版记录页把报告作为独立出版物登记(China Development Brief 2017a, 2017b)。香港跨性别资源中心也保留报告介绍,形成跨地区的同期发现入口(Transgender Resource Center Hong Kong 2017)。
跨与多元性别档案随后为同一对象增加文件级描述。当前档案页明确展示 Chinese_Transgender_Population_General_Survey_Report.pdf,标注 PDF 格式、文件大小、MD5、归档日期、原始链接、作者、地区、年份与标签,并提供文件下载(Chinese Transgender Digital Archive 2026a)。这组字段让一个“报告”变成可计算的档案对象:文件名和 MD5 支持副本识别,原始链接保留来源关系,作者与年份支持检索,标签支持主题入口。
档案页的自动生成摘要则展示另一类边界。页面明确标注摘要与附加信息为自动生成并供检索参考。这个标记本身是一项重要的来源元数据:它告诉研究者,摘要属于档案的发现层,报告正文属于证据层。AI 时代的数字档案可以把这种角色区分继续机器化,例如为字段增加 generated_description=true、evidence_source=file、original_url=...,让后续系统自动选择适合的证据层。
Gil 等人关于可复现研究对象的建议把数据、软件、文档和 provenance 连接在一起;档案页的文件级字段与这一思路具有结构相似性(Gil et al. 2016)。对跨性别历史而言,这种 provenance 设计还可以帮助未来研究者辨认一次网站迁移前后的文件是否属于同一版本。
6. 二〇一七校园/证件报告与二〇一九证件手册:社群文档怎样获得机器入口
《跨性别校园与证件修改调查报告》与《跨性别证件修改手册》代表两种社群与法律实践文档。前者把高校信息公开、校园经历调查和证件修改问题放进一份报告;后者把身份证、户口、学历与资格证件修改流程整理成服务型手册。它们的最初价值来自行动和服务场景,后来的档案化又增加了研究入口。
跨与多元性别档案目前为校园/证件报告提供独立元数据页和 PDF 下载,为证件手册提供标题、作者“彩虹律师团”、二〇一九年日期、PDF 文件名、文件大小、MD5、归档时间与原始链接(Chinese Transgender Digital Archive 2026b, 2026c)。这类“档案包装”将历史对象从孤立文件升级为可搜索记录。机器可以先在 HTML 元数据层判断对象主题、年代和作者,再按需要进入文件正文。
档案包装也承担版本历史。原始组织网站、网盘或文档站点发生迁移时,archive record 可以继续保存 original_link 和归档时间。Acker 与 Kreisberg关于 API 驱动平台档案的研究提醒我们,访问接口是档案条件的一部分;Caswell 与 Cifor关于关系伦理的论述又把描述责任放进档案实践(Acker & Kreisberg 2020; Caswell & Cifor 2016)。面向社群历史,技术字段和描述伦理可以共同工作:机器字段说明文件从哪里来,人工说明解释文件是什么、由谁生产、适合回答什么问题。
这种结构还降低了术语变化带来的检索成本。旧文件标题可能使用当时的制度语言,档案标签可以添加今日主题词。研究者随后同时保留原题名与现代主题词,从而维持历史用语与当前发现路径之间的桥接。
7. 国际特赦组织二〇一九报告:文本型 PDF 展示“深读接口”
国际特赦组织二〇一九年关于中国跨性别者性别确认医疗障碍的报告拥有成熟的多层发布结构。报告落地页提供题名、日期、文档编号、语言选择和 PDF 下载;简体中文页面提供对应版本;英文 PDF 保留封面、版权页、目录、章节编号、术语表和完整正文(Amnesty International 2019a, 2019b, 2019c)。
公开解析结果显示,这份四十七页 PDF 具有可抽取文本层,目录可以解析为章节名称与页码,正文段落也可以按页恢复。对 AI 工作流而言,这类 PDF 已经跨过最基础的“图像到字符”门槛。下一步任务转向结构恢复:把换行、页眉、脚注、表格与正文区分出来,并把引用定位回页码。Baviskar 等人对非结构化文档自动处理的综述、Nguyen 等人对 post-OCR 的综述都说明,字符可得只是文档理解链的一环,布局与纠错继续影响下游抽取质量(Baviskar et al. 2021; Nguyen et al. 2021)。
PDF 同时提供 HTML 难以完全替代的页级证据。报告中的页码、图表位置和脚注布局可以支持精确引用;落地页则提供更好的发现入口。机器可读证据梯因此把“可解析正文”和“结构锚点”分开记录。一份 PDF 可以拥有高质量文本层,却需要额外布局恢复;一份 HTML 可以拥有清晰标题层级,却缺少固定页码。两者的强项共同构成研究基础设施。
8. 二〇二一年全国健康调研:大文件、目录页与双重档案入口
《2021全国跨性别健康调研报告》展示了另一种文档规模。CNLGBTDATA 的目录页记录报告题名、发布日期、主要创作者与议题分类,并另有长文介绍和 PDF 下载;跨与多元性别档案则记录文件名、PDF 格式、约五十四 MB 的文件大小、MD5、归档日期、原始链接、地区、年份和标签(CNLGBTDATA 2023a, 2023b; Chinese Transgender Digital Archive 2026d)。
这组入口说明“大文件”本身可以转化成机器可读元数据。系统在下载全文之前,已经能够知道它是什么、来自哪一年、当前文件多大、现存副本指向哪里。对于批量研究而言,这一步可以支持队列排序与缓存策略:先从 HTML 目录层构建对象清单,再为需要全文分析的对象取得文件。数字人文长期强调馆藏级元数据与全文之间的接口;Borgman 对数字人文基础设施的讨论以及 Terras 对开放数字馆藏的研究都指出,访问方式会直接塑造可开展的研究(Borgman 2009; Terras 2015)。
跨与多元性别档案还提供 MD5。哈希值专门回答文件身份问题:两个镜像是否字节相同、某次迁移是否替换了文件、下载缓存是否对应记录中的对象。对于持续更新的 AI 索引,这种文件身份字段可以避免同一版本被重复嵌入,也可以在文件变化时触发重新处理。
9. 二〇二二 G05:通知页与附件体系里的政策机器可读性
二〇二二年国家卫生健康委发布《国家限制类技术目录和临床应用管理规范(2022年版)》,通知页保留文号、发布日期、施行关系和附件入口,并明确旧版规范随新规施行而废止;“性别重置技术”作为 G05 进入新版限制类技术体系(National Health Commission 2022)。政策史研究在这里同时需要“通知对象”和“附件对象”。
通知页提供版本关系。它说明谁发布、何时发布、哪套旧规范退出、附件属于哪次正式通知。附件保存具体规范。AI 系统若只取得附件正文,可能丢失施行时间与取代关系;若只取得通知摘要,又缺少具体条款。一个完整的政策对象因此适合用关系结构表示:notice -> has_attachment -> G05 standard,同时保留 supersedes 与发布日期。
Fickers 所说的数字取证式历史方法强调对数字对象、版本和生成条件进行批判性检查(Fickers 2020)。政策附件体系正好说明来源关系为何属于机器可读性的一部分。真正可持续的政策问答系统需要同时知道条文内容与条文身份;来源图谱因此与全文索引具有同等基础地位。
10. 机器可读证据梯:六个字段如何组成可审计对象
十二组样本可以压缩成一个可复用的数据结构。本文建议每个历史对象至少维护以下字段:
{object_id, title, publisher, published_at, source_role, landing_url, file_url, text_mode, structure_mode, original_url, archive_url, filename, format, size, checksum, language, version, relation_to_other_object, observed_at}
其中 text_mode 可以记录 html、pdf_text、ocr_text、image 等状态;structure_mode 可以记录标题层级、目录、页码与表格是否可定位;source_role 则区分 official publication、institutional record、community report、archive description、legal mirror、press release。字段值均来自可验证的公开对象。
在此基础上,机器可读证据梯形成六层连续任务:
- 对象身份:标题、作者/机构、日期和文号使系统知道它正在处理哪一个历史对象。
- 可解析正文:HTML 或文档文本层使关键词、句子和段落进入全文检索。
- 结构锚点:章节、目录、页码、表格和标题层级支持可复核的定位。
- 来源关系:原始链接、镜像说明、归档说明和上下游通知连接历史语境。
- 文件身份:文件名、大小、哈希和版本区分同名材料与后续替换。
- 冗余发现入口:机构页、档案页、法律镜像、目录与搜索入口让对象保持多路径可达。
这套梯子和九月一日提出的 source-survival stack 关注不同尺度。source-survival stack 描述一个对象怎样跨网站与时间存活;机器可读证据梯描述当对象已经抵达研究者面前时,它向文本系统开放了哪些可审计字段。两者可以串联:保存层保证对象持续存在,机器可读层保证对象进入检索与分析时仍携带身份、结构与 provenance。
11. AI 发现债务:需要多少转换,才能形成可引用证据
本文把AI 发现债务定义为:从公开入口到可引用、可追溯的结构化证据之间仍需执行的转换工作。债务可以来自缺少对象元数据、正文仅存在于图像、章节结构丢失、原始来源关系模糊、文件版本身份缺失,或同一对象只有单一入口。这个概念专门记录工作量与证据风险。
例如,一个机构落地页同时提供标题、日期、发布者、摘要和双语 PDF,系统可以直接建立对象记录,再下载全文处理。一个档案页拥有文件名、MD5、原始链接和标签,也能快速形成 provenance。一个独立 PDF 仍可被完整保存和阅读,但系统需要从文档内部恢复题名、作者、日期与章节;一个图像型文件还要增加 OCR 与版面恢复步骤。Muehlberger 等人的历史文本识别研究和 Nguyen 等人的 post-OCR 综述说明,每次转换都会产生可测量的识别与校正任务(Muehlberger et al. 2019; Nguyen et al. 2021)。
AI 发现债务也可以被分项记录:
discovery_debt = metadata_recovery + text_recovery + structure_recovery + provenance_recovery + version_recovery
这是一种操作模型,研究团队按分项状态使用。研究团队可以记录每一项为 ready / derived / manual_review。当一份报告的标题和日期由 HTML 直接提供时,metadata_recovery=ready;当正文来自 OCR 时,text_recovery=derived;当原始发布机构需要人工考证时,provenance_recovery=manual_review。这种三态记录能更细致地表达历史研究中的证据准备程度。
12. 反证与边界:机器可读性与历史真实性承担不同任务
机器可读性提升检索与抽取效率,历史真实性继续依赖来源批判。档案页的自动摘要能够帮助搜索,但摘要页已经明确把自动生成内容标记为检索参考;原文件继续承担实质证据角色(Chinese Transgender Digital Archive 2026a)。同理,专题法律镜像可以提供出色的章节导航,权威发布页继续提供制度出处。两者组合的证据强度高于把任一入口单独承担全部角色。
PDF 也展现同样的互补性。固定页码与视觉布局服务精确引用和版式史,HTML 服务全文发现与链接关系。扫描影像可以保存纸面痕迹,OCR 文本提供搜索层。Ehrmann 等人的历史文档实体识别综述显示,历史文本的语言变化、版面和识别误差会影响自动实体抽取;Colavizza 等人则把 AI 在档案中的机会与描述、偏差、透明度和专业判断放在同一讨论中(Ehrmann et al. 2023; Colavizza et al. 2022)。
另一个边界来自规模。本文是固定样本观察,样本覆盖具有代表性的政策、调查、医院与社群文档形态,目标是建立可复用方法。它适合回答“哪些接口存在、怎样记录”,后续大规模测量可以再回答“多少比例的馆藏拥有文本层”“OCR 错误怎样随年代和版式变化”“哪些字段最能改善跨语言召回”。固定样本先把测量单位定义清楚。
13. 面向下一代档案与 AI 检索的实践方案
第一项实践是为每个重要文件建立 HTML 对象身份页。身份页至少保留原题名、作者/发布机构、原始发布日期、语言、文件链接、来源角色和原始 URL。文件继续原样保存,HTML 负责发现和对象关系。
第二项实践是把“文本层”标记为有来源的衍生物。OCR、PDF 文本提取和人工转写都可以生成检索文本,同时记录工具、日期和对应文件哈希。研究者于是能够把搜索命中的句子追溯回具体文件和页码。Survey of Post-OCR Processing Approaches 所总结的后处理流程提示,文本层本身也具有版本历史(Nguyen et al. 2021)。
第三项实践是保留结构。章节标题、页码、表格编号、图注和脚注关系比单纯一串纯文本更适合深度检索。历史 NER、文档理解和生成式问答都能从结构锚点中获益。自动系统返回答案时,可以同时返回 object_id + section + page + source_url。
第四项实践是把 provenance 变成图。UNDP 报告页面与 PDF、国家通知与附件、档案页与原始链接、法律镜像与正式规范都可以用显式关系连接。这样,AI 在给出内容答案之前,已经拥有“这是原始发布、同期报道还是后期档案”的角色信息。
第五项实践是周期性检查对象身份与文件身份。落地页状态、原始链接、镜像、文件哈希和归档入口可以形成轻量巡检。Massicotte 与 Botter 对机构库 reference rot 的个案研究说明,即使专业存储环境也需要持续检查链接关系(Massicotte & Botter 2017)。这项工作与数字保存巡检天然兼容。
结论:AI 时代的史料基础设施从“保存文件”走向“保存可读关系”
二〇〇九至二〇二二年的中国大陆跨性别公共史料,在二〇二六年的网络上呈现出丰富的文档形态。国家卫生主管部门和医院提供 HTML 制度与机构记录,UNDP 和国际特赦组织使用落地页连接长篇 PDF,中国发展简报保留发布语境与下载入口,CNLGBTDATA 提供目录对象,跨与多元性别档案为迁移文件补充格式、大小、哈希、原始链接与归档日期,Project Trans 将政策文本组织成专题化可定位网页。这些接口共同形成机器检索可以使用的历史基础设施。
机器可读证据梯把这种基础设施拆成六层:对象身份 → 可解析正文 → 结构锚点 → 来源关系 → 文件身份 → 冗余发现入口。六层分别维护对象、文本、结构、provenance、版本与发现路径。AI 发现债务进一步记录每份材料在进入可引用分析之前需要完成的元数据恢复、文本恢复、结构恢复、来源恢复和版本恢复工作。
对历史研究而言,最有价值的方向是把原文件与机器可读关系一起保存。PDF 保留页码与版式,HTML 提供对象身份与发现,OCR 或文本提取提供全文入口,档案元数据提供来源和文件身份,独立镜像提供冗余入口。未来的检索系统因此可以同时回答内容问题与来源问题:某句话来自哪份文件、哪个版本、哪一页、哪个发布机构、哪一个原始链接,以及今天通过哪些公共入口仍可找到它。这样的基础设施让 AI 加速发现,也让历史证据继续保持可审计、可复核和可追溯。
参考文献
- Putnam, Lara. 2016. “The Transnational and the Text-Searchable: Digitized Sources and the Shadows They Cast.” American Historical Review 121(2): 377–402. https://academic.oup.com/ahr/article-pdf/121/2/377/25736337/zah377.pdf
- Klein, Martin, Herbert Van de Sompel, Robert Sanderson, Harihar Shankar, Lyudmila Balakireva, Ke Zhou, and Richard Tobin. 2014. “Scholarly Context Not Found: One in Five Articles Suffers from Reference Rot.” PLOS ONE. https://journals.plos.org/plosone/article?id=10.1371/journal.pone.0115253
- Jones, Shawn M., Herbert Van de Sompel, Harihar Shankar, Martin Klein, Richard Tobin, and Claire Grover. 2016. “Scholarly Context Adrift: Three out of Four URI References Lead to Changed Content.” PLOS ONE. https://journals.plos.org/plosone/article?id=10.1371/journal.pone.0167475
- Sanderson, Robert, Mark Edward Phillips, and Herbert Van de Sompel. 2011. “Analyzing the Persistence of Referenced Web Resources with Memento.” https://arxiv.org/abs/1105.3459
- Dougherty, Meghan, Eric T. Meyer, Christine Madsen, Charles van den Heuvel, Arthur Thomas, and Sally Wyatt. 2017. “Researcher Engagement with Web Archives: State of the Art.” https://ecommons.luc.edu/cgi/viewcontent.cgi?article=1014&context=communication_facpubs
- Acker, Amelia, and Adam Kreisberg. 2020. “Social Media Data Archives in an API-Driven World.” https://link.springer.com/article/10.1007/s10502-019-09325-9
- Jaillant, Lise, and Annalina Caputo. 2022. “Unlocking Digital Archives: Cross-Disciplinary Perspectives on AI and Born-Digital Data.” https://link.springer.com/article/10.1007/s00146-021-01367-x
- Brügger, Niels. 2012. “When the Present Web Is Later the Past: Web Historiography, Digital History and Internet Studies.” http://www.ssoar.info/ssoar/handle/document/38378
- Colavizza, Giovanni, Tobias Blanke, Charles Jeurgens, and Julia Noordegraaf. 2022. “Archives and AI: An Overview of Current Debates and Future Perspectives.” https://dl.acm.org/doi/10.1145/3479010
- Ehrmann, Maud, Ahmed Hamdi, Elvys Linhares Pontes, Matteo Romanello, and Antoine Doucet. 2023. “Named Entity Recognition and Classification in Historical Documents: A Survey.” https://dl.acm.org/doi/10.1145/3604931
- Nguyen, Thi Tuyet Haï, Adam Jatowt, Mickaël Coustaty, and Antoine Doucet. 2021. “Survey of Post-OCR Processing Approaches.” https://dl.acm.org/doi/10.1145/3453476
- Muehlberger, Guenter, Louise Seaward, Melissa Terras, et al. 2019. “Transforming Scholarship in the Archives through Handwritten Text Recognition.” https://infoscience.epfl.ch/record/270774/files/10-1108_JD-07-2018-0114.pdf
- Terras, Melissa. 2015. “Opening Access to Collections: The Making and Using of Open Digitised Cultural Content.” https://www.research.ed.ac.uk/files/46486196/Terras2015OIROpeningAccess.pdf
- Borgman, Christine L. 2009. “The Digital Future Is Now: A Call to Action for the Humanities.” https://dhq-static.digitalhumanities.org/pdf/000077.pdf
- Westergaard, David, Hans-Henrik Stærfeldt, Christian Tønsberg, Lars Juhl Jensen, and Søren Brunak. 2018. “A Comprehensive and Quantitative Comparison of Text-Mining in 15 Million Full-Text Articles versus Their Corresponding Abstracts.” https://journals.plos.org/ploscompbiol/article?id=10.1371/journal.pcbi.1005962
- Baviskar, Dipali, Swati Ahirrao, Vidyasagar Potdar, and Ketan Kotecha. 2021. “Efficient Automated Processing of the Unstructured Documents Using Artificial Intelligence: A Systematic Literature Review and Future Directions.” https://ieeexplore.ieee.org/document/9402739
- Starr, Joan, Eleni Castro, Mercè Crosas, et al. 2015. “Achieving Human and Machine Accessibility of Cited Data in Scholarly Publications.” https://ir.cwi.nl/pub/25200/pj4237.pdf
- Gil, Yolanda, Cédric H. David, İbrahim Demir, et al. 2016. “Toward the Geoscience Paper of the Future: Best Practices for Documenting and Sharing Research from Data to Software to Provenance.” https://onlinelibrary.wiley.com/doi/10.1002/2015EA000136
- Massicotte, Mia, and Kathleen Botter. 2017. “Reference Rot in the Repository: A Case Study of Electronic Theses and Dissertations (ETDs) in an Academic Library.” https://ejournals.bc.edu/index.php/ital/article/view/9598
- Fickers, Andreas. 2020. “Update für die Hermeneutik. Geschichtswissenschaft auf dem Weg zur digitalen Forensik?” http://orbilu.uni.lu/handle/10993/44086
- Caswell, Michelle, and Marika Cifor. 2016. “From Human Rights to Feminist Ethics: Radical Empathy in the Archives.” http://archivaria.ca/index.php/archivaria/article/view/13557
- Caswell, Michelle, Alda Allina Migoni, Noah Geraci, and Marika Cifor. 2017. “‘To Be Able to Imagine Otherwise’: Community Archives and the Importance of Representation.” https://escholarship.org/uc/item/1h54v9m9
- Guo, Shaohua. 2020. The Evolution of the Chinese Internet: Creative Visibility in the Digital Public. Stanford University Press. https://www.sup.org/books/asian-studies/evolution-chinese-internet
- Ministry of Health of the People’s Republic of China. 2009. “变性手术技术管理规范(试行).” https://www.nhc.gov.cn/zwgk/wtwj/201304/5a310ec69d264d4a890949d0b2fbcaf7.shtml
- National Health Commission of the PRC. 2022. “国家卫生健康委办公厅关于印发国家限制类技术目录和临床应用管理规范(2022年版)的通知.” https://www.nhc.gov.cn/yzygj/c100068/202204/2655831f6f444b00b3e50604e67531f5.shtml
- Project Trans. 2026a. “变性手术技术管理规范(试行).” https://project-trans.org/china-legal/spec/2009-11-13/srs/readme/
- UNDP. 2016. Being LGBTI in China. https://www.undp.org/china/publications/being-lgbti-china
- UNDP. 2018a. Legal Gender Recognition in China: A Legal and Policy Review. https://www.undp.org/china/publications/legal-gender-recognition-china-legal-and-policy-review
- UNDP China. 2018b. “UNDP and China Women’s University Release Legal Gender Recognition Report.” https://www.undp.org/china/press-releases/undp-and-china-womens-university-release-legal-gender-recognition-report
- China Development Brief. 2017a. “中国跨性别群体生存现状调查报告圆满发布.” https://www.chinadevelopmentbrief.org.cn/news/detail/17772.html
- China Development Brief. 2017b. “2017 Chinese Transgender Population General Survey Report.” https://chinadevelopmentbrief.org/publications/2017-chinese-transgender-population-general-survey-report/
- Chinese Transgender Digital Archive. 2026a. “Chinese_Transgender_Population_General_Survey_Report.” https://digital.transchinese.org/%E7%A4%BE%E7%BE%A4%E5%8F%8ANGO%E6%96%87%E4%BB%B6/%E7%BB%9F%E8%AE%A1%E6%8A%A5%E5%91%8A/Chinese_Transgender_Population_General_Survey_Report_page/
- Transgender Resource Center Hong Kong. 2017. “2017中国跨性别群体生存现状调查报告.” https://www.tgr.org.hk/index.php/zh/2017/11/20/2017-chinese-transgender-population-general-survey-report/
- Chinese Transgender Digital Archive. 2026b. “跨性别校园与证件修改调查报告.” https://digital.transchinese.org/%E7%A4%BE%E7%BE%A4%E5%8F%8ANGO%E6%96%87%E4%BB%B6/%E7%BB%9F%E8%AE%A1%E6%8A%A5%E5%91%8A/%E8%B7%A8%E6%80%A7%E5%88%AB%E6%A0%A1%E5%9B%AD%E4%B8%8E%E8%AF%81%E4%BB%B6%E4%BF%AE%E6%94%B9%E8%B0%83%E6%9F%A5%E6%8A%A5%E5%91%8A_page/
- Chinese Transgender Digital Archive. 2026c. “跨性别证件修改手册.” https://digital.transchinese.org/%E7%A4%BE%E7%BE%A4%E5%8F%8ANGO%E6%96%87%E4%BB%B6/%E6%89%8B%E5%86%8C%E6%8C%87%E5%8D%97/%E8%B7%A8%E6%80%A7%E5%88%AB%E8%AF%81%E4%BB%B6%E4%BF%AE%E6%94%B9%E6%89%8B%E5%86%8C_page/
- Amnesty International. 2019a. China: “I Need My Parents’ Consent to Be Myself”: Barriers to Gender-Affirming Treatments for Transgender People in China. https://www.amnesty.org/en/documents/asa17/0269/2019/en/
- Amnesty International. 2019b. “我需要家长同意才能做自己——中国跨性别者寻求性别确认医疗程序时遇到的障碍.” https://www.amnesty.org/zh-hans/documents/asa17/0269/2019/zh-hans/
- Amnesty International. 2019c. Report PDF. https://www.amnesty.org/en/wp-content/uploads/2021/05/ASA1702692019ENGLISH.pdf
- CNLGBTDATA. 2023a. “2021全国跨性别健康调研报告.” https://cnlgbtdata.com/doc/314/
- Chinese Transgender Digital Archive. 2026d. “2021全国跨性别健康调研报告.” https://digital.transchinese.org/%E7%A4%BE%E7%BE%A4%E5%8F%8ANGO%E6%96%87%E4%BB%B6/%E7%BB%9F%E8%AE%A1%E6%8A%A5%E5%91%8A/2021%E5%85%A8%E5%9B%BD%E8%B7%A8%E6%80%A7%E5%88%AB%E5%81%A5%E5%BA%B7%E8%B0%83%E7%A0%94%E6%8A%A5%E5%91%8A_page/
- PUH3 Department of Plastic Surgery. 2018. “北医三院易性症序列医疗团队成立.” https://www.sar.com.cn/xinwen/news/12295.html
- Common Language. 2020. “影响性诉讼⑦:这次,把‘性别认同及性别表达’写进判决.” https://commonlanguage.github.io/TYarchives2020/20200518_1%E5%BD%B1%E5%93%8D%E6%80%A7%E8%AF%89%E8%AE%BC%E2%91%A6%E8%BF%99%E6%AC%A1%EF%BC%8C%E6%8A%8A%E2%80%9C%E6%80%A7%E5%88%AB%E8%AE%A4%E5%90%8C%E5%8F%8A%E6%80%A7%E5%88%AB%E8%A1%A8%E8%BE%BE%E2%80%9D%E5%86%99%E8%BF%9B%E5%88%A4%E5%86%B3.html
- Chinese Transgender Digital Archive. 2026e. “变性手术技术管理规范(试行).” https://digital.transchinese.org/%E6%94%BF%E5%BA%9C%E5%8F%8A%E5%AE%98%E6%96%B9%E7%BB%84%E7%BB%87%E6%96%87%E4%BB%B6/%E4%B8%AD%E5%9B%BD%E5%A4%A7%E9%99%86/%E5%8F%98%E6%80%A7%E6%89%8B%E6%9C%AF%E6%8A%80%E6%9C%AF%E7%AE%A1%E7%90%86%E8%A7%84%E8%8C%83%EF%BC%88%E8%AF%95%E8%A1%8C%EF%BC%89/
- Chinese Transgender Digital Archive. 2026f. Homepage. https://digital.transchinese.org/
- Common Crawl. 2026. “Open Repository of Web Crawl Data.” https://commoncrawl.org/
- Memento. 2026. “Time Travel for the Web.” https://mementoweb.org/about/