前言
每天要刷 RSS、逛搜索引擎、翻各个科技媒体才能知道发生了什么热点。RSS 只管推文章不管质量,搜索引擎塞满广告,时间线按 relevance 排序找不到最新内容。
市面上的 AI 搜索工具要么付费,要么不支持联网搜索。即使支持联网,也要自己写爬虫去抓取、清洗、去重,非常麻烦。
能不能让 AI 帮我做这件事?输入关键词,自动搜索、去广告、按时间排好、整理多角度观点、出报告。
于是有了 Hotspot。
项目定位
基于 DeepSeek 免费网页版的自动化技术热点搜索工具。纯免费,不需要 API Key,不需要付费订阅。比 RSS 更智能,比搜索更干净。
一句话:输入关键词,AI 自动搜索、去重、验证链接、整理多角度观点,生成一份可以直接看的报告。
系列导读
本文是 Hotspot 项目的「功能篇」,聚焦工具的核心价值、功能特性与使用效果。如果你想深入了解底层实现原理、代码设计与工程踩坑经验,可移步姊妹篇:《Hotspot — 零成本热点追踪工具(技术实现篇)》
为什么不用 TrendRadar
市面上已经有 TrendRadar(58.6K+ Star)这样的热点聚合工具,但我还是自己写了 Hotspot,原因是:
数据源决定了天花板。 TrendRadar 从微博、知乎、B站、抖音等 11+ 平台的热榜和 RSS 源抓取内容。这些平台的热榜天然偏向社会热点、娱乐八卦,而不是纯技术进展。即使它提供了强大的关键词语法过滤(支持 + 必须词、! 排除词、正则匹配)和 AI 兴趣筛选,但也只是在社交热榜的结果之上做过滤。源数据就不是技术内容,过滤得再好也得不到纯技术热点。
结果里大多是「技术风口炒作」而非技术本身。 即使严格控制关键词和白名单,社交平台上关于"技术"的内容大多还是融资新闻、市场分析、大佬言论这类风口话题。真正的技术进展——Rust 1.96.1 发布了什么、Docker Engine 29.6.0 有哪些变更——在微博热榜和 B 站热门上是看不到的。
AI 需要额外付费,而且救不了输入质量。 TrendRadar 接入了 DeepSeek/OpenAI API 做摘要和情感分析,但这需要你自己提供 API Key,按量付费。而且 AI 执行的是对已抓取结果的二次加工——如果爬到的东西本身就不精准,AI 再加工也救不回来。
所以我需要的不是另一个社会热点聚合器,而是一个真正理解「技术热点」的工具。 Hotspot 让 DeepSeek 联网搜索直接理解什么是技术热点,不依赖社交平台热榜,不经过 RSS 过滤,不需要手动清洗广告和噪音。
示例网站: hotspot.lxpavilion.top
核心功能详解
多关键词批量搜索
在 config.json 里配好关键词列表,程序自动逐个搜索,不用管中间的切换过程。
"keywords": ["DeepSeek", "ChatGPT", "Rust", "Kubernetes", "Docker"]
每个关键词生成独立的搜索结果,互不干扰。跑完后自动合并为一份聚合报告。
深度思考 + 智能搜索
程序启动后自动打开 DeepSeek 的「深度思考」和「智能搜索」两个开关,确保 AI 先联网查资料再思考回答,而不是靠训练数据里过时的知识硬答。
整个过程对用户完全透明——你只需要配置一次,程序自动操作网页。
去重去广告
DeepSeek 返回的结果中,同一个链接可能在不同位置出现多次。程序自动按 URL 去重,相同链接只保留一条。
同时 HEAD 请求验证每个链接是否可达。404 页面、连接失败的链接自动剔除,不会出现在最终报告里。
按时间排序
从 DeepSeek 返回的摘要中解析出每条热点的发布时间,最新热点排在最前面。不再被「按热度排序」绑架,一眼看到今天刚发生的事。
多角度观点提取
每条热点不是简单的一条新闻标题。AI 会自动整理不同立场和争议观点,放在 perspectives 字段里。看一个技术热点,你能同时看到官方态度、社区反应、争议焦点。
URL 验证
AI 会编造链接,这是使用大模型做搜索必须面对的问题。程序中设置了三重防护:
- 提示词约束:明确告诉 AI "宁可 null 不要假链接"
- 引用链接匹配:从 DeepSeek 回复底部的引用列表提取真实链接,替换掉空的 URL
- HEAD 请求验证:对每个链接发 HEAD 请求,404 的自动剔除
JSON + HTML 双报告
搜索结果同时生成两种格式:
- JSON:结构化数据,方便程序二次处理
- HTML:深色主题可视化页面,支持 Tab 切换关键词,可直接浏览器打开
Session 持久化
首次登录 DeepSeek 后,浏览器 Cookie 自动保存到本地 session/storage_state.json。后续运行直接复用,不需要重复登录。
这个设计还有一个巧妙的副作用:即使在 GitHub Actions 这种受限环境,如果 Session 还没过期,也能跳过登录直接搜索。
封禁检测
账号被封或网络被拦截时,程序能识别到页面的封禁提示,给出明确报错信息而不是卡死。同时生成空报告,确保部署流程不会中断。
开发历程
整个过程大概花了一周,踩了不少坑。
1. DuckDuckGo 搜索
最开始用 DuckDuckGo 的搜索 API,不需要注册免费调用。这是最快的起步方案——零配置、零费用。
但现实很残酷:国内网络连 DuckDuckGo 极慢,一个请求要 40-60 秒,完全没法用。技术方案再好,网络不通就白搭。
2. Bing 爬虫
换 Bing 直接爬网页搜索,速度快了很多(2 秒左右),还能解析摘要里的时间信息做筛选。
问题在于搜到的内容混杂搜索结果和广告,需要写大量的过滤逻辑来清洗。广告链接、教程站点、无关页面…… 过滤规则越写越多,但总有漏网之鱼。
而且搜索引擎返回的结果本质上是「含有关键词的页面」,不是「与该关键词相关的热点」——这两者的差距非常大。
3. DeepSeek 网页版
试了一下 DeepSeek 的联网搜索,效果比搜索引擎好太多——能直接返回结构化的热点信息,自带多角度观点提取和舆情总结。
方向彻底变了。不再爬搜索引擎,而是让 AI 直接搜。这个转变是整个项目最关键的一次决策。
4. URL 假链接
DeepSeek 会编造链接。比如返回一个 ithome.com/0/000/000.htm 这样的链接,看起来像真的,实际上是编造的。
用提示词约束 + HEAD 请求验证 + 引用链接匹配,三重防护才压住这个问题。
5. 会话管理
从手动登录到自动登录到 session 持久化,折腾了很久。每个环节都有坑:登录按钮的选择器变了、验证码弹出来了、session 过期了……
6. 对话清理
不删对话导致每搜一个关键词就多一个历史记录,浏览器内存越占越多,最后程序崩溃。加上自动删除对话的功能后解决。
7. 被封禁
headless 模式反复触发 DeepSeek 风控,账号被禁言。加上封禁检测后流程能完整走完,不会卡死。
8. 流水线折腾
GitHub Actions(被 Cloudflare 拦截)→ Gitee Go(不好用)→ 回到 GitHub → 最终写了 deploy.bat 本地部署。
每次改完都很累,但项目确实一步步完善了。
成果示例
以搜索 Docker 关键词为例,输出结果:
#1 微软推出WSL Containers,无需Docker Desktop即可运行Linux容器
来源: 快科技 | 时间: 2026-06-29
URL: https://www.163.com/dy/article/L0JRDK5S0511CPVM.html
#2 Docker Engine 29.6.0正式发布,多项安全更新与功能增强
来源: VersionLog | 时间: 2026-06-24
#3 云原生安全面临新挑战:容器逃逸与供应链攻击频发
来源: 企业IT培训 | 时间: 2026-06-26
聚合报告以 HTML 形式展示,Tab 切换关键词,深色主题,毛玻璃卡片风格。
总结
回过头来看,这个项目最有价值的不是代码,而是几点认知:
- AI 的输出不能直接信任。 链接要验证、JSON 要兜底、结果要清洗。AI 是强大的助手但不是可靠的数据源。
- 提示词是核心竞争力。 同样的需求不同的措辞效果天差地别。写好提示词带来的提升比调代码大得多。
- 自动化要考虑所有异常路径。 封禁、拦截、超时、空结果…… 每个环节都要考虑"出错了怎么办"。
- 不要为了自动化而自动化。 本地运行 + 推送往往比 CI 更可靠。能跑通比跑得花哨重要。
🔗 延伸阅读
如果你对 Hotspot 的技术实现感兴趣,想了解 Playwright 浏览器自动化、反检测方案、JSON 容错解析、URL 三重验真等底层设计,可阅读姊妹篇:《Hotspot — 零成本热点追踪工具(技术实现篇)》
项目地址: github.com/PC2005-clou… 示例网站: hotspot.lxpavilion.top