- 发布日期
TS Index 索引覆盖与每周更新记录
- 作者

- 姓名
- 多元寻迹
- 社交账号
这是一份持续更新的覆盖与数据质量记录,而不是把每天的操作日志搬到公开网站。它回答几个长期有用的问题:TS Index 当前能搜索多少条记录、覆盖多少个来源域名、限制级内容是否仍包含在完整索引里、最近增加了哪些可追溯来源,以及哪些数字能够由静态产物直接验证。
所有总数都以发布时的 search-indexes/manifest.json 为准。来源页面和搜索结果会继续变化,因此这里保存的是有日期的发布快照;首页与来源档案显示的是当前部署版本。
2026-09-07:59 个来源域名,39,416 条可搜索记录
本周发布后的静态索引包含 39,416 条来源记录和 39,416 条可搜索记录,覆盖 59 个来源域名。其中 27,052 条带有限制级分级,重复 canonical URL 诊断仍为 0。
这里最重要的等式是:来源记录数 = 可搜索记录数。限制级是一项元数据分类,不是删除条件;因此 27,052 条限制级记录已经包含在 39,416 条总记录中,而不是被排除在搜索之外。构建会独立验证这一点,只要一条有效来源记录因为分级而从静态搜索产物消失,完整语料检查就应失败。
与 2026-08-31 的 39,364 条记录、39 个域名相比,本周净增加 52 条可搜索记录和 20 个来源域名。记录增长既包括新接入的精选机构页面,也包括已批准 Wiki 来源的上游 metadata 同步;不能把全部 52 条都解释为“20 个新网站各新增一页”。
本周新增的来源类型
这周刻意把覆盖重心放在高 provenance、适合长期引用的小型机构与历史来源,而不是继续扩大已经占据大量记录的文学或镜像档案。
数字典藏与文化保存。 新增了台湾数字典藏目录、台湾影视听数字博物馆、台湾女性影像学会、微光之境、政府出版品资讯网、国家人权博物馆,以及本周末接入的 OUT Museum 和 台北当代艺术馆。这些来源提供书目、影像史、博物馆、展览或社群文化的第一方入口,TS Index 只保存发现所需 metadata 与原创摘要,不复制作品或展览正文。
大学与研究机构。 新增台湾师范大学台湾语文学系、岭南大学 Digital Commons、中大《大学线》、教育部人权教育资源网、政大法学院、香港大学、香港大学法律学院,以及 CityUHK Scholars。它们补充台湾与香港的跨性别历史、影视/体育文化、法律职业生命史、公众态度研究和中国法律史资料。已结束的活动与旧研究会明确保留日期,不被描述成当前报名、法律或医疗信息。
人权与公共记录。 新增 Civilmedia 对台湾首次跨性别游行的原创历史报道,并在本次更新加入 国际特赦组织台湾分会 与 台湾人权促进会 的日期明确的人权倡议记录。倡议页面保存发布者立场和历史语境;兵役、医疗程序、法律性别或行政规则仍需要回到最新政府、司法或专业来源核对。
香港社群公共教育。 PrideLab 的 2021–2022 多元跨性别/非二元教育媒体页成为新的精选来源。索引只保存 landing-page metadata,不复制影片或逐字稿,也不把资助背景解释成政府政策背书。
为什么小型精选来源也值得加入
一个只有一条记录的来源不一定比拥有数千条记录的大档案价值低。对研究者而言,第一方政府页面、大学活动记录、机构研究 portal、博物馆展览页和社群历史项目往往能回答“谁在什么时间发布了什么”这一类 provenance 问题。
TS Index 因此区分“来源覆盖”与“记录规模”。大档案有助于全文发现,小型精选来源则提高出处多样性、历史可追溯性和地区覆盖。新域名只有在直接相关、公开可访问、发布者可识别、canonical link 稳定并且 metadata 范围可安全维护时才会接入;不会为了让来源数好看而增加重复、宽泛或无法核验的网站。
本周的数据质量边界
本周继续维持几个不会为了增长数字而放宽的边界:
- 限制级记录保留在完整静态索引中,分级不会触发物理删除;
- canonical URL 重复是需要诊断的问题,不是允许静默丢弃来源记录的理由;
- 医疗、法律、兵役、服务、活动和政策页面必须保留发布者与日期边界;
- 旧活动继续作为历史记录时,不会被写成当前报名机会;
- 第三方作品、论文、影片、新闻和展览正文不会因为索引接入而被复制;
- 来源暂时离线、维护或迁移时,优先更新状态和 provenance,而不是删除已有有效记录。
本周没有为了来源增长而降低 restricted count,也没有以重分类或删除旧记录制造净增长。
搜索与发布健康
生产搜索仍是浏览器端静态搜索:页面先读取 manifest,再按查询需要加载内容寻址的文档分片与 inverted posting buckets。旧的服务器搜索端点已经退休,生产上继续以静态搜索为唯一搜索路径;退休端点不作为静态搜索的后备 API。
每次搜索面对的来源变更都必须通过源记录计数、完整语料、来源 profile、固定查询、静态构建、canonical/robots/sitemap、限制级保存和生产域名验收。gh-pages 仅作为与 Cloudflare Pages 同一来源构建的静态镜像交叉验证,不是独立的第二套生产语料。
分析数据能说明什么,不能说明什么
索引 manifest 可以证明记录数、来源数、限制级分级和重复 URL 诊断;它不能证明搜索流量、点击率或排名提高。当前仓库没有可用于本次发布结论的 finalized GA4 / Google Search Console 聚合导出,因此这里不把部署成功解释成 sessions、CTR、平均排名或转化增长。
同样,公开搜索引擎偶尔发现品牌词或页面并不等于存在经过验证的外部链接。只有实际检查第三方页面并确认它链接到 canonical TS Index 页面,才能记录为 verified external link。
下一轮优先事项
接下来的重点不是追求更大的记录数,而是继续提高可验证性与使用体验:重新核验此前暂缓的香港社区来源;为法律与服务页补足更清楚的 freshness 边界;继续扩充台湾、香港及华语离散社群的历史/文化第一方来源;维护固定查询和浏览器成本基线;并在 provider 聚合数据真正可用时,把流量与搜索表现纳入这份报告。
如果某个来源失效、状态变化、metadata 有误或缺少重要 provenance,可以先查看对应来源档案的覆盖说明,再通过项目维护渠道提交可复现的更正线索。