多端业务知识花园

公开能看,不等于能爬

浏览器里能打开的页面,不等于可以用程序自动去抓。反过来,个人非商业的自建采集器,也不等于当然违法。公开资讯自动化的合规,落在一条很具体的线上:你用什么方式、拿什么字段、频率多高。

红黄绿三级准入

我们用的准入模型分三级:

  1. 绿色:来源方明确提供且允许相应用途的官方 RSS/API、产品权限内的 Web Search、使用者主动提供的材料。直接用。
  2. 黄色:无登录即可访问的公开列表页、公告页或 RSSHub route。只有同时满足三个条件才可低频采集元数据:robots.txt 未禁止目标路径、法律声明未明确禁止相应用途、实现不使用登录态或私有接口。
  3. 红色:明确禁止通用机器人或相应自动化使用的来源,以及需要登录、Cookie、验证码、付费墙、签名、频控绕过、代理轮换或私有接口的 route。永久不由自建采集器直连。

输出默认只保留标题、机构、日期、原始链接和许可范围内的短摘要,不保存媒体正文、图片或评论。

永久禁止项

以下六条是用户明确确认的硬边界,不是"首期暂缓",而是后续实现的验收失败条件:

  1. 媒体全文抓取
  2. 登录态、Cookie、个人账号或共享账号采集
  3. 付费墙、验证码、访问频控、签名校验和反自动化措施绕过
  4. 未公开、未授权或通过逆向发现的私有接口
  5. 伪装浏览器、轮换代理或规避封禁
  6. 与资讯简报无关的个人信息采集

真实核验过的例子

规则不是空想,是逐站核验出来的:中国人民银行的 robots.txt 对通用机器人设置了 Disallow: /,法律声明也限制未经许可的下载使用——直接自动化抓取不应准入。中国证监会的法律声明确认网站信息版权归属并限制未经许可的更改、销售或租赁。上海证券交易所允许符合声明的非商业浏览、下载,但限制以牟利为目的的电子抓取、存储和传播。

注意一个常见误解:robots.txt 不存在、为空或请求失败,只能说明没发现机器可读声明,不能当成自动化授权。

技术边界

服务端固定来源白名单,模型和客户端不能传入任意 URL;遇到 401/403/429、验证码或反自动化页面立即停止;默认单来源每 30-60 分钟最多检查一次、并发为 1;普通 Feed 响应上限 2MiB/12 秒,超限取消读取且不截断解析。

还有一条容易被忽视的:人工发现和自动采集要分开建模。人工浏览只负责发现标题,代码只读本地整理结果,不访问人工来源网页——人和机器的责任边界在代码层面就要分开。

质量同样是准入条件

合规之外,质量门禁也淘汰过来源:一个免费资讯 API 前 20 条相关率只有 35%、跨查询组重复约 50%;另一个供应商 145 条候选中官方发布日期命中目标日期的只有六分之一。官方域名限制不能替代发布日期核验,可达性也不能替代条款授权。

小结

公开资讯自动化的合规只有一句话:只拿允许拿的,只用允许的方式,拿不到就放弃这个来源。命中明确禁止项的直接排除;规则不清的保持默认关闭,完成逐站记录后再决定。

© 2026 rotor®GitHub 开源CC BY-NC-ND · 转载请注明出处