告别无效刷榜:免费 AI 工具,自动追踪纯技术热点生成报告

0 阅读8分钟

前言

每天要刷 RSS、逛搜索引擎、翻各个科技媒体才能知道发生了什么热点。RSS 只管推文章不管质量,搜索引擎塞满广告,时间线按 relevance 排序找不到最新内容。

市面上的 AI 搜索工具要么付费,要么不支持联网搜索。即使支持联网,也要自己写爬虫去抓取、清洗、去重,非常麻烦。

能不能让 AI 帮我做这件事?输入关键词,自动搜索、去广告、按时间排好、整理多角度观点、出报告。

于是有了 Hotspot

image.png

项目定位

基于 DeepSeek 免费网页版的自动化技术热点搜索工具。纯免费,不需要 API Key,不需要付费订阅。比 RSS 更智能,比搜索更干净。

一句话:输入关键词,AI 自动搜索、去重、验证链接、整理多角度观点,生成一份可以直接看的报告。

系列导读

本文是 Hotspot 项目的「功能篇」,聚焦工具的核心价值、功能特性与使用效果。如果你想深入了解底层实现原理、代码设计与工程踩坑经验,可移步姊妹篇:《Hotspot — 零成本热点追踪工具(技术实现篇)》

为什么不用 TrendRadar

市面上已经有 TrendRadar(58.6K+ Star)这样的热点聚合工具,但我还是自己写了 Hotspot,原因是:

数据源决定了天花板。 TrendRadar 从微博、知乎、B站、抖音等 11+ 平台的热榜和 RSS 源抓取内容。这些平台的热榜天然偏向社会热点、娱乐八卦,而不是纯技术进展。即使它提供了强大的关键词语法过滤(支持 + 必须词、! 排除词、正则匹配)和 AI 兴趣筛选,但也只是在社交热榜的结果之上做过滤。源数据就不是技术内容,过滤得再好也得不到纯技术热点。

结果里大多是「技术风口炒作」而非技术本身。 即使严格控制关键词和白名单,社交平台上关于"技术"的内容大多还是融资新闻、市场分析、大佬言论这类风口话题。真正的技术进展——Rust 1.96.1 发布了什么、Docker Engine 29.6.0 有哪些变更——在微博热榜和 B 站热门上是看不到的。

AI 需要额外付费,而且救不了输入质量。 TrendRadar 接入了 DeepSeek/OpenAI API 做摘要和情感分析,但这需要你自己提供 API Key,按量付费。而且 AI 执行的是对已抓取结果的二次加工——如果爬到的东西本身就不精准,AI 再加工也救不回来。

所以我需要的不是另一个社会热点聚合器,而是一个真正理解「技术热点」的工具。 Hotspot 让 DeepSeek 联网搜索直接理解什么是技术热点,不依赖社交平台热榜,不经过 RSS 过滤,不需要手动清洗广告和噪音。

示例网站: hotspot.lxpavilion.top

核心功能详解

多关键词批量搜索

config.json 里配好关键词列表,程序自动逐个搜索,不用管中间的切换过程。

"keywords": ["DeepSeek", "ChatGPT", "Rust", "Kubernetes", "Docker"]

每个关键词生成独立的搜索结果,互不干扰。跑完后自动合并为一份聚合报告。

深度思考 + 智能搜索

程序启动后自动打开 DeepSeek 的「深度思考」和「智能搜索」两个开关,确保 AI 先联网查资料再思考回答,而不是靠训练数据里过时的知识硬答。

整个过程对用户完全透明——你只需要配置一次,程序自动操作网页。

去重去广告

DeepSeek 返回的结果中,同一个链接可能在不同位置出现多次。程序自动按 URL 去重,相同链接只保留一条。

同时 HEAD 请求验证每个链接是否可达。404 页面、连接失败的链接自动剔除,不会出现在最终报告里。

按时间排序

从 DeepSeek 返回的摘要中解析出每条热点的发布时间,最新热点排在最前面。不再被「按热度排序」绑架,一眼看到今天刚发生的事。

多角度观点提取

每条热点不是简单的一条新闻标题。AI 会自动整理不同立场和争议观点,放在 perspectives 字段里。看一个技术热点,你能同时看到官方态度、社区反应、争议焦点。

image.png

URL 验证

AI 会编造链接,这是使用大模型做搜索必须面对的问题。程序中设置了三重防护

  1. 提示词约束:明确告诉 AI "宁可 null 不要假链接"
  2. 引用链接匹配:从 DeepSeek 回复底部的引用列表提取真实链接,替换掉空的 URL
  3. HEAD 请求验证:对每个链接发 HEAD 请求,404 的自动剔除

JSON + HTML 双报告

搜索结果同时生成两种格式:

  • JSON:结构化数据,方便程序二次处理
  • HTML:深色主题可视化页面,支持 Tab 切换关键词,可直接浏览器打开

image.png

Session 持久化

首次登录 DeepSeek 后,浏览器 Cookie 自动保存到本地 session/storage_state.json。后续运行直接复用,不需要重复登录。

这个设计还有一个巧妙的副作用:即使在 GitHub Actions 这种受限环境,如果 Session 还没过期,也能跳过登录直接搜索。

封禁检测

账号被封或网络被拦截时,程序能识别到页面的封禁提示,给出明确报错信息而不是卡死。同时生成空报告,确保部署流程不会中断。

image.png

开发历程

整个过程大概花了一周,踩了不少坑。

1. DuckDuckGo 搜索

最开始用 DuckDuckGo 的搜索 API,不需要注册免费调用。这是最快的起步方案——零配置、零费用。

但现实很残酷:国内网络连 DuckDuckGo 极慢,一个请求要 40-60 秒,完全没法用。技术方案再好,网络不通就白搭。

2. Bing 爬虫

换 Bing 直接爬网页搜索,速度快了很多(2 秒左右),还能解析摘要里的时间信息做筛选。

问题在于搜到的内容混杂搜索结果和广告,需要写大量的过滤逻辑来清洗。广告链接、教程站点、无关页面…… 过滤规则越写越多,但总有漏网之鱼。

而且搜索引擎返回的结果本质上是「含有关键词的页面」,不是「与该关键词相关的热点」——这两者的差距非常大。

3. DeepSeek 网页版

试了一下 DeepSeek 的联网搜索,效果比搜索引擎好太多——能直接返回结构化的热点信息,自带多角度观点提取和舆情总结。

方向彻底变了。不再爬搜索引擎,而是让 AI 直接搜。这个转变是整个项目最关键的一次决策。

4. URL 假链接

DeepSeek 会编造链接。比如返回一个 ithome.com/0/000/000.htm 这样的链接,看起来像真的,实际上是编造的。

用提示词约束 + HEAD 请求验证 + 引用链接匹配,三重防护才压住这个问题。

5. 会话管理

从手动登录到自动登录到 session 持久化,折腾了很久。每个环节都有坑:登录按钮的选择器变了、验证码弹出来了、session 过期了……

6. 对话清理

不删对话导致每搜一个关键词就多一个历史记录,浏览器内存越占越多,最后程序崩溃。加上自动删除对话的功能后解决。

7. 被封禁

headless 模式反复触发 DeepSeek 风控,账号被禁言。加上封禁检测后流程能完整走完,不会卡死。

8. 流水线折腾

GitHub Actions(被 Cloudflare 拦截)→ Gitee Go(不好用)→ 回到 GitHub → 最终写了 deploy.bat 本地部署。

每次改完都很累,但项目确实一步步完善了。

image.png

成果示例

以搜索 Docker 关键词为例,输出结果:

#1 微软推出WSL Containers,无需Docker Desktop即可运行Linux容器
  来源: 快科技 | 时间: 2026-06-29
  URL: https://www.163.com/dy/article/L0JRDK5S0511CPVM.html

#2 Docker Engine 29.6.0正式发布,多项安全更新与功能增强
  来源: VersionLog | 时间: 2026-06-24

#3 云原生安全面临新挑战:容器逃逸与供应链攻击频发
  来源: 企业IT培训 | 时间: 2026-06-26

聚合报告以 HTML 形式展示,Tab 切换关键词,深色主题,毛玻璃卡片风格。

总结

回过头来看,这个项目最有价值的不是代码,而是几点认知:

  • AI 的输出不能直接信任。 链接要验证、JSON 要兜底、结果要清洗。AI 是强大的助手但不是可靠的数据源。
  • 提示词是核心竞争力。 同样的需求不同的措辞效果天差地别。写好提示词带来的提升比调代码大得多。
  • 自动化要考虑所有异常路径。 封禁、拦截、超时、空结果…… 每个环节都要考虑"出错了怎么办"。
  • 不要为了自动化而自动化。 本地运行 + 推送往往比 CI 更可靠。能跑通比跑得花哨重要。

🔗 延伸阅读

如果你对 Hotspot 的技术实现感兴趣,想了解 Playwright 浏览器自动化、反检测方案、JSON 容错解析、URL 三重验真等底层设计,可阅读姊妹篇:《Hotspot — 零成本热点追踪工具(技术实现篇)》

项目地址: github.com/PC2005-clou… 示例网站: hotspot.lxpavilion.top