透明的数据口径
数据收录与统计方法
这份说明用于帮助你正确理解热搜时光机中的日期、时间、排名、热度和上榜记录。本站保存的是定时采集到的公开榜单快照,不是来源平台提供的官方完整历史库。
数据流程
热搜时光机的数据从采集到展示,经过以下四个步骤:
步骤 1
数据采集
定时读取公开可访问的微博热搜榜单
步骤 2
数据存储
保存快照、排名、热度和时间戳
步骤 3
数据处理
计算上榜次数、最高热度和趋势
步骤 4
数据展示
按日期、关键词和时间提供查询
数据来源与采集频率
采集频率
热搜时光机定时读取公开可访问的微博热搜榜单,计划采集频率为每 2 分钟一次。实际快照间隔可能受来源页面、网络状态、任务调度和维护影响,因此不能把每 2 分钟理解为每个时刻都必然存在记录。
日期与时间口径
北京时间(UTC+8)
对用户展示的日期和时间统一按北京时间(UTC+8)解释。每日归档根据北京自然日组织,历史时光机在用户选择目标时间后,定位数据库中接近该时刻的可用快照。
排名、热度与上榜次数
以下是在热搜时光机中常见指标的定义和使用注意事项:
排名
某次采集快照中词条所在的位置
数字越小表示位置越靠前
热度
来源榜单在相应时刻展示的指标
只适合在相近口径下比较
上榜记录
本站采集快照中观察到该词条的次数
不等同于独立事件数量
最高热度
从本站已有历史记录中计算的最大值
基于已有数据,非官方统计
每日归档如何生成
代表性榜单
日期页从当天已有快照中选择具有代表性的榜单用于公开回顾,并保留通往前后日期、词条详情和历史现场的入口。它用于快速了解当天热点,不应理解为一天内所有排名变化的合集。
缺失、异常与更正
数据边界
来源页面结构变化、访问限制、网络故障或采集任务中断都可能形成数据缺口。页面显示异常时,可以通过关于页面提供的交流群反馈。经核实的程序或解析问题会在后续版本修复,但不会凭空补造无法验证的历史榜单。