摘要

Agentic Search 是 Mistral 面向 AI 系统的检索层。它不做一次性分块检索,而是让模型在既有搜索索引上多步循环,用 search、open、navigate、read、grep 五个类文件系统工具在复杂文档里查找、核对并验证信息。交付有两条路:开源的 Mistral Search Toolkit 负责数据摄取、嵌入和索引,可部署在云端或本地;Studio 和 Vibe 里内置开箱即用的库,GitHub 上还有 Search Starter App 可按默认配置建本地索引。整个设计模型无关、不需要微调,检索质量随模型能力提升,不会被分块策略封顶。官方自报数据(默认未调优):FinanceBench(SEC 财报)正确率从 26.7% 升到 86%,OfficeQA Pro(Treasury Bulletins)从 6.3% 升到 51.9%,p90 延迟最高降 39.6%,token 用量最多省三分之一;测试用了 Mistral Medium 3.5 和 Z.ai GLM-5.2。

为什么重要
一次性 RAG 在需要翻长报告、跨来源对比、读表格脚注的问题上有结构性短板,Agentic Search 的思路是给模型迭代式的文档操作,而不是更巧的分块。索引留在你自己的安全边界内,加上开放的 Toolkit 路径,敏感企业数据也能用。模型无关的定位意味着可以拿它和自己的技术栈对比评测。注意:数字是厂商自报的,测的是文档密集场景,且未公布定价,独立复现还没有出现。
技术细节
工具 search、open、navigate、read、grep:模型在既有索引上循环驱动的类文件系统操作
机制 多步迭代检索;不需要微调或针对特定模型的训练;检索质量随模型能力提升
交付 Mistral Search Toolkit:开放模块(摄取 / 嵌入 / 索引),可云端或本地部署 · Studio 和 Vibe 内置的库 · GitHub Search Starter App(本地索引 + 默认配置)
基准测试 FinanceBench(SEC 财报):正确率 26.7% → 86%(最高 3 倍) · OfficeQA Pro(Treasury Bulletins):6.3% → 51.9%(+45.6 点) · p90 延迟:最高 -39.6% · token 用量:最多 -1/3
测试模型 Mistral Medium 3.5、Z.ai GLM-5.2(验证模型无关的主张)
注意 基准数字为厂商自报;测的是文档密集场景(财报、公告);公告未给出定价
与知识库的关系 首个把 agentic 检索循环做成产品的厂商发布;同日的学术呼应 DeepWeaver(arXiv 2608.18988)登记为早期迹象观察项,不立趋势
标签
mistralagentic-searchragretrievaldocument-qabenchmarkrelease