MCP之聊聊给模型接搜索这件事
目录
MCP之聊聊给模型接搜索这件事
模型不是不行,是缺输入
模型是在猜。给它真实的、实时的输入因子,它就猜得更准。裸用就是扔骰子。
依赖厂商数据质量:模型能答成什么样,全看训练它的数据。数据旧了、偏了、没覆盖到,模型就答不出来或答不对。你问它训练数据截止日期之后发生的事,它只能编。
概率机制:模型本质是猜下一个 token,不是知道了答案再输出。同一个问题采样路径不同,结果就不同。没有外部信号校准,它只能在训练分布里随机游走。
输入因子:模型猜得准不准,取决于你给它多少真实信息。信息越少越像扔骰子,信息越多越接近事实。裸用模型就是让它蒙着眼睛答——脑子里有货,但看不见外面。
搜索工具听起来解决了这个问题,但没解决干净
WebSearch 有,但不一定触发;触发了,搜回来的也不一定是人看的。
触发信号:模型不会主动调 WebSearch——prompt 里没有明确的"去搜"信号,它默认不走搜索路径。你给了钥匙,但没告诉它门是可以开的。
信息噪声:搜回来的网页噪声大于信号。SEO 文章、过时文档、互相抄袭的内容占满上下文,token 涨了,幻觉也跟着涨。
国内搜索:政策限制下基本只搜国内站。CSDN 淘金是常态——翻十篇水文,找不到一行能用的。
三个值得接的 MCP
搜索结果从"一堆网页"变成"结构化答案",只是第一步。选哪个 MCP,取决于你要解决什么问题。
Brave Search MCP
独立搜索引擎,每月 1,000 次免费。
定位:独立搜索索引,不依赖 Google/Bing。自己维护了 300 亿+ 页面索引,日均更新 1 亿页面。相当于给 AI 接了一个自己的搜索引擎。
为什么需要:搜索结果是干净的 JSON,不走 HTML 解析。最特别的是 LLM Context 端点——专为 AI 上下文优化,返回结构化摘要片段,不需要 AI 自己从网页里提取正文。还支持按类型搜索:网页、新闻、图片、视频、本地。
免费额度:每月 $5 免费额度 = 1,000 次 Web Search 或 1,250 次 Answers。
缺点:Answers 端点限 2 QPS 偏慢。只能搜,不能做页面内容提取和爬取。
JSON 配置:
{
"mcpServers": {
"brave-search": {
"command": "npx",
"args": ["-y", "@anthropic-ai/mcp-server-brave-search"],
"env": {
"BRAVE_API_KEY": "<your-key>"
}
}
}
}
Tavily MCP
Agent 原生 Web 访问层,每月 1,000 credits 免费,无需信用卡。
定位:专为 AI Agent 设计——不只是搜,还带提取、爬取和网站地图。Agent 搜到结果后可以直接深入提取页面内容,一套工具走完。
为什么需要:搜索只是第一步,拿到链接之后还要进去看内容。Tavily 把搜索+提取+爬取合成了一条链路,Agent 不用从搜索跳转到另一个工具再提取。内置安全防护:自动拦截 PII 泄露、提示注入攻击和恶意来源。
免费额度:每月 1,000 API credits 免费,无需信用卡。学生全免费。
缺点:用的不是独立索引(聚合搜索结果),credits 消耗机制不够透明。搜索类型不如 Brave 丰富(没有图片/视频/新闻分类)。
JSON 配置:
{
"mcpServers": {
"tavily": {
"command": "npx",
"args": ["-y", "mcp-remote", "https://mcp.tavily.com/mcp/?tavilyApiKey=<your-key>"]
}
}
}
Context7 MCP
代码库文档查询,完全免费。
定位:不是 Web 搜索。是"查最新 API 文档"——解决 LLM 训练数据里 API 文档过时的问题。
为什么需要:你让 AI 写代码,它给出的 API 用法可能是上一个版本的。比如你问"Next.js 的 middleware 怎么写",它给的答案可能还是 12 的写法。Context7 拉最新文档,保证你拿到的是当前版本的 API。58k GitHub stars 说明这是个普遍痛点。
免费额度:完全免费,从 context7.com/dashboard 拿 API Key。
缺点:只能查代码库文档,不能搜网页。依赖库必须在它的索引覆盖范围内。
JSON 配置:
{
"mcpServers": {
"context7": {
"command": "npx",
"args": ["-y", "@upstash/context7-mcp@latest"],
"env": {
"CONTEXT7_API_KEY": "<your-key>"
}
}
}
}
三者一览
| Brave Search | Tavily | Context7 | |
|---|---|---|---|
| 定位 | 独立搜索引擎 | Agent Web 访问层 | 代码文档查询 |
| 免费额度 | 每月 1,000 次 | 每月 1,000 credits | 完全免费 |
| 核心能力 | 网页搜索 + LLM 上下文 + 图片/视频/新闻 | 搜索 + 提取 + 爬取 + 网站地图 | 最新库文档查询 |
| 适合场景 | 通用网页搜索,干净结构化结果 | Agent 深度调研,需要提取页面内容 | 写代码时需要最新 API 文档 |
| 缺点 | 只能搜,不能提取爬取 | 非独立索引,搜索类型少 | 只能查代码文档 |
还有一个场景:你的知识盲区
你不熟悉的领域,模型更没法凭空变出正确答案。但给它搜索能力,它能帮你看得更全。
盲区问题:你在不熟悉的领域提问,模型靠训练数据硬答——说得像真的,但你判断不了。你俩都在盲区里,它说什么你都得听着。
信息茧房:不靠搜索,就是你问它答你点头的三人转。对不上的地方,谁也发现不了。
解法:接上搜索 MCP,模型先查再答。你不需要提前知道方向,它自己去翻最新资料,带回来再给你建议。等于探索陌生领域时身边多了一个能随时查资料的人。
为什么外接搜索对模型这么重要
搜索不是过渡方案,是模型进化的基础设施。
训练滞后:模型是阶段式训练——收数据、训一批、发版本,周期固定。知识永远是旧的。让模型学会用工具这件事本身也需要大量交互数据训练拟合,不是调 prompt 能解决。
原生路线:DeepSeek 在尝试把网页搜索融进模型推理过程——不是外挂工具,是推理时自带检索和筛选能力。叠上 embedding 自学习和总结,上限更高。但召回准确性和长上下文注意力漂移的问题还没解决。
search agent:不管走哪条路线,结论不变——搜索不是临时方案。未来模型进化方向不是靠更密集的训练批次更新知识,而是模型自己能站在互联网信息流里持续获取、归纳、自我迭代。到那时候,搜索不是可选的插件,是模型的基本存在方式。就跟今天的人遇到问题去搜一下一样自然。
更多推荐

所有评论(0)