更多文章🚀🚀🚀

MCP之聊聊给模型接搜索这件事

模型不是不行,是缺输入

模型是在猜。给它真实的、实时的输入因子,它就猜得更准。裸用就是扔骰子。

依赖厂商数据质量:模型能答成什么样,全看训练它的数据。数据旧了、偏了、没覆盖到,模型就答不出来或答不对。你问它训练数据截止日期之后发生的事,它只能编。

概率机制:模型本质是猜下一个 token,不是知道了答案再输出。同一个问题采样路径不同,结果就不同。没有外部信号校准,它只能在训练分布里随机游走。

输入因子:模型猜得准不准,取决于你给它多少真实信息。信息越少越像扔骰子,信息越多越接近事实。裸用模型就是让它蒙着眼睛答——脑子里有货,但看不见外面。

搜索工具听起来解决了这个问题,但没解决干净

WebSearch 有,但不一定触发;触发了,搜回来的也不一定是人看的。

触发信号:模型不会主动调 WebSearch——prompt 里没有明确的"去搜"信号,它默认不走搜索路径。你给了钥匙,但没告诉它门是可以开的。

信息噪声:搜回来的网页噪声大于信号。SEO 文章、过时文档、互相抄袭的内容占满上下文,token 涨了,幻觉也跟着涨。

国内搜索:政策限制下基本只搜国内站。CSDN 淘金是常态——翻十篇水文,找不到一行能用的。

三个值得接的 MCP

搜索结果从"一堆网页"变成"结构化答案",只是第一步。选哪个 MCP,取决于你要解决什么问题。

Brave Search MCP

独立搜索引擎,每月 1,000 次免费。

定位:独立搜索索引,不依赖 Google/Bing。自己维护了 300 亿+ 页面索引,日均更新 1 亿页面。相当于给 AI 接了一个自己的搜索引擎。

为什么需要:搜索结果是干净的 JSON,不走 HTML 解析。最特别的是 LLM Context 端点——专为 AI 上下文优化,返回结构化摘要片段,不需要 AI 自己从网页里提取正文。还支持按类型搜索:网页、新闻、图片、视频、本地。

免费额度:每月 $5 免费额度 = 1,000 次 Web Search 或 1,250 次 Answers。

缺点:Answers 端点限 2 QPS 偏慢。只能搜,不能做页面内容提取和爬取。

JSON 配置

{
  "mcpServers": {
    "brave-search": {
      "command": "npx",
      "args": ["-y", "@anthropic-ai/mcp-server-brave-search"],
      "env": {
        "BRAVE_API_KEY": "<your-key>"
      }
    }
  }
}

Tavily MCP

Agent 原生 Web 访问层,每月 1,000 credits 免费,无需信用卡。

定位:专为 AI Agent 设计——不只是搜,还带提取、爬取和网站地图。Agent 搜到结果后可以直接深入提取页面内容,一套工具走完。

为什么需要:搜索只是第一步,拿到链接之后还要进去看内容。Tavily 把搜索+提取+爬取合成了一条链路,Agent 不用从搜索跳转到另一个工具再提取。内置安全防护:自动拦截 PII 泄露、提示注入攻击和恶意来源。

免费额度:每月 1,000 API credits 免费,无需信用卡。学生全免费。

缺点:用的不是独立索引(聚合搜索结果),credits 消耗机制不够透明。搜索类型不如 Brave 丰富(没有图片/视频/新闻分类)。

JSON 配置

{
  "mcpServers": {
    "tavily": {
      "command": "npx",
      "args": ["-y", "mcp-remote", "https://mcp.tavily.com/mcp/?tavilyApiKey=<your-key>"]
    }
  }
}

Context7 MCP

代码库文档查询,完全免费。

定位:不是 Web 搜索。是"查最新 API 文档"——解决 LLM 训练数据里 API 文档过时的问题。

为什么需要:你让 AI 写代码,它给出的 API 用法可能是上一个版本的。比如你问"Next.js 的 middleware 怎么写",它给的答案可能还是 12 的写法。Context7 拉最新文档,保证你拿到的是当前版本的 API。58k GitHub stars 说明这是个普遍痛点。

免费额度:完全免费,从 context7.com/dashboard 拿 API Key。

缺点:只能查代码库文档,不能搜网页。依赖库必须在它的索引覆盖范围内。

JSON 配置

{
  "mcpServers": {
    "context7": {
      "command": "npx",
      "args": ["-y", "@upstash/context7-mcp@latest"],
      "env": {
        "CONTEXT7_API_KEY": "<your-key>"
      }
    }
  }
}

三者一览

Brave SearchTavilyContext7
定位独立搜索引擎Agent Web 访问层代码文档查询
免费额度每月 1,000 次每月 1,000 credits完全免费
核心能力网页搜索 + LLM 上下文 + 图片/视频/新闻搜索 + 提取 + 爬取 + 网站地图最新库文档查询
适合场景通用网页搜索,干净结构化结果Agent 深度调研,需要提取页面内容写代码时需要最新 API 文档
缺点只能搜,不能提取爬取非独立索引,搜索类型少只能查代码文档

还有一个场景:你的知识盲区

你不熟悉的领域,模型更没法凭空变出正确答案。但给它搜索能力,它能帮你看得更全。

盲区问题:你在不熟悉的领域提问,模型靠训练数据硬答——说得像真的,但你判断不了。你俩都在盲区里,它说什么你都得听着。

信息茧房:不靠搜索,就是你问它答你点头的三人转。对不上的地方,谁也发现不了。

解法:接上搜索 MCP,模型先查再答。你不需要提前知道方向,它自己去翻最新资料,带回来再给你建议。等于探索陌生领域时身边多了一个能随时查资料的人。

为什么外接搜索对模型这么重要

搜索不是过渡方案,是模型进化的基础设施。

训练滞后:模型是阶段式训练——收数据、训一批、发版本,周期固定。知识永远是旧的。让模型学会用工具这件事本身也需要大量交互数据训练拟合,不是调 prompt 能解决。

原生路线:DeepSeek 在尝试把网页搜索融进模型推理过程——不是外挂工具,是推理时自带检索和筛选能力。叠上 embedding 自学习和总结,上限更高。但召回准确性和长上下文注意力漂移的问题还没解决。

search agent:不管走哪条路线,结论不变——搜索不是临时方案。未来模型进化方向不是靠更密集的训练批次更新知识,而是模型自己能站在互联网信息流里持续获取、归纳、自我迭代。到那时候,搜索不是可选的插件,是模型的基本存在方式。就跟今天的人遇到问题去搜一下一样自然。

更多文章🚀🚀🚀

Logo

欢迎加入 MCP 技术社区!与志同道合者携手前行,一同解锁 MCP 技术的无限可能!

更多推荐