信源说明
本站不生产新闻。首页信息流中的全部转载条目,均来自下列公开发布的 RSS 订阅源;点击任意标题可查看该条目的公开摘要,并跳转到原媒体阅读全文。
当前接入的公开信源
抓取方式
网页打开时会依次尝试三种方式获取最新内容:
- 浏览器直连:部分信源(如德国之声中文)允许跨域读取,直接解析其 RSS。
- 公共 RSS 代理:其余信源通过公开的 rss2json 服务读取,绕开浏览器跨域限制。
- 本地快照:以上都不可用时(例如断网),回退到仓库内的
data/news.json,网站仍可正常浏览。
抓取结果会在浏览器本地缓存 15 分钟;点击首页的“刷新”按钮可强制重新抓取。
更新离线快照
在项目目录下运行下面的命令,即可重新抓取全部信源并写入 data/news.json:
python3 tools/fetch_news.py
脚本会输出每个信源的抓取条数。若某个信源改版或下线,只需修改 tools/fetch_news.py 与 js/store.js 顶部的信源列表。
配图从哪里来
信息流中的每一条新闻都会有图,来源按优先级依次是:
- RSS 自带配图:法广、IT 之家、少数派等信源会在订阅源里直接给出图片;
- 正文页配图:中新网等信源的 RSS 不带图,
tools/fetch_news.py会回到正文页读取og:image或正文容器内的首张图片,写入本地快照。提取会在“相关新闻”“责任编辑”等位置截断,并剔除被多篇文章复用的模板宣传图,避免把别人的照片安到这条新闻上。最近一次抓取中,290 条里有 195 条拿到真实配图; - 仍然没有图的条目不进信息流:不少通稿本身就是纯文字消息,这类条目会从首页隐藏, 首页状态栏会写明隐藏了多少条;它们仍保留在快照中,按 id 直接访问文章页仍可打开。 按栏目生成的版式封面只在本站原创稿件缺图或远程图片加载失败时兜底。
浏览器受跨域限制无法读取正文页,所以实时抓取到的新条目会先用快照里的配图回填;重新运行抓取脚本即可为最新条目补上真实配图。
栏目是怎么分的
每个信源有默认栏目(例如中国新闻网默认归入“中国”)。对综合类信源,程序会依据标题与摘要中的关键词,把条目细分到财经、科技、文化或体育;本站原创稿件单独归入“人物”等栏目。