透明的数据口径

数据收录与统计方法

这份说明用于帮助你正确理解热搜时光机中的日期、时间、排名、热度和上榜记录。本站保存的是定时采集到的公开榜单快照,不是来源平台提供的官方完整历史库。

数据流程

热搜时光机的数据从采集到展示,经过以下四个步骤:

步骤 1

数据采集

定时读取公开可访问的微博热搜榜单

步骤 2

数据存储

保存快照、排名、热度和时间戳

步骤 3

数据处理

计算上榜次数、最高热度和趋势

步骤 4

数据展示

按日期、关键词和时间提供查询

数据来源与采集频率

采集频率

热搜时光机定时读取公开可访问的微博热搜榜单,计划采集频率为每 2 分钟一次。实际快照间隔可能受来源页面、网络状态、任务调度和维护影响,因此不能把每 2 分钟理解为每个时刻都必然存在记录。

日期与时间口径

北京时间(UTC+8)

对用户展示的日期和时间统一按北京时间(UTC+8)解释。每日归档根据北京自然日组织,历史时光机在用户选择目标时间后,定位数据库中接近该时刻的可用快照。

排名、热度与上榜次数

以下是在热搜时光机中常见指标的定义和使用注意事项:

排名

某次采集快照中词条所在的位置

数字越小表示位置越靠前

热度

来源榜单在相应时刻展示的指标

只适合在相近口径下比较

上榜记录

本站采集快照中观察到该词条的次数

不等同于独立事件数量

最高热度

从本站已有历史记录中计算的最大值

基于已有数据,非官方统计

每日归档如何生成

代表性榜单

日期页从当天已有快照中选择具有代表性的榜单用于公开回顾,并保留通往前后日期、词条详情和历史现场的入口。它用于快速了解当天热点,不应理解为一天内所有排名变化的合集。

缺失、异常与更正

数据边界

来源页面结构变化、访问限制、网络故障或采集任务中断都可能形成数据缺口。页面显示异常时,可以通过关于页面提供的交流群反馈。经核实的程序或解析问题会在后续版本修复,但不会凭空补造无法验证的历史榜单。