
在支撑人工智能应用的底层基础设施中,Markdown 正逐渐取代 JavaScript Object Notation ( JSON ) ,成为模型读取内容的默认输出格式。这一转变反映了大型语言模型(LLM)的训练机制、聊天界面的渲染逻辑,以及开发者对令牌(tokens)、上下文窗口和成本的深层考量。
Markdown 契合模型工作流
大型语言模型已在海量 Markdown 数据(如文档网站、README 文件、技术博客及知识库)上完成训练。这种高曝光度使模型能流利 " 理解 "Markdown,将其标题、列表、表格和代码块视为语义信号而非噪声。
在用户侧,聊天界面可直接渲染 Markdown 答案,无需前端额外转换。当模型摄入 Markdown 时,其接收的信息形式与训练分布及预期响应高度一致。相比需要复杂解析的嵌套 JSON,Markdown 构建了更自然的输入 - 输出循环。
从令牌视角看,Markdown 去除了结构冗余,保留了核心信息载荷。对于受限于上下文窗口的 AI 智能体而言,这种效率直接转化为单次请求中更高的内容密度及更低的推理成本。
行业最佳实践的确立
向 Markdown 的迁移已体现在主流模型提供商的指导方针中。OpenAI 提示工程文档明确建议,使用 Markdown 标题(如 "##")、项目符号和表格来结构化消息,以提升模型的合规性与可读性。
第三方提示指南也遵循此模式,利用 Markdown 进行章节分隔、枚举和比较。多项分析指出,凭借更高的令牌效率及对基于文档训练模型的友好性,Markdown 已成为复杂提示的首选格式,尤其在新的 GPT-5 系列模型中表现显著。
基础设施层的共识
API 和数据提供商正纷纷提供针对 LLM 消费优化的 Markdown 变体,旨在减少令牌膨胀、简化智能体解析,并与模型的提示及展示方式保持一致。
拥有九年历史的搜索数据 API 公司 SerpApi 最近在其全部 100 多个 API 中推出了免费的 Markdown 输出功能。该功能允许开发者通过查询参数、路由扩展或标头,以 Markdown 格式请求来自 Google、Bing、YouTube 等来源的结构化洞察,专门面向 AI 智能体及 LLM 驱动的应用。
SerpApi 的基准测试显示,一次针对 "coffee" 的 Google 搜索,若以 JSON 返回需消耗 24,723 个令牌,而 Markdown 仅需 6,435 个,降幅达 74%;结合字段过滤后,令牌数进一步降至 1,298 个。总体而言,SerpApi 报告的平均令牌节省率约为 50%,部分端点降幅高达 90%。
搜索结果通常包含重定向链接、跟踪参数及深层嵌套元数据等 " 噪声 ",这些并非模型推理所需。Markdown 输出则自动剥离此类干扰,仅保留标题、摘要、链接、价格和评分等核心信息,并以表格和列表形式呈现,便于直接嵌入提示或智能体记忆。
趋势展望
随着网络内容越来越多地被智能体而非人类消费,基础设施层正从 " 人类友好的嵌套结构 " 转向优化 " 机器可读性 "。尽管 JSON 在程序化操作和严格模式执行中仍至关重要,但在 AI 工作流的上下文摄入阶段,Markdown 正成为新的默认值。
预计未来几个月,搜索、电子商务、地图和内容 API 等领域的数据提供商将广泛提供 Markdown 变体,因为令牌效率直接影响成本和性能。提示模板和智能体框架也可能标准化使用 Markdown 的章节、表格和列表,作为向模型呈现检索上下文的规范方式。
对于当前使用 LLM 开发的开发者而言,趋势已现:在向模型输入外部数据时,应优先选择与模型训练及输出方式相匹配的格式。Markdown 不再仅是文档工具,它正成为搜索数据与 AI 模型之间的新通用语。
【星途科讯 图文丨三一一 首发于 ZAKER 科技,转载请注明出处】


登录后才可以发布评论哦
打开小程序可以发布评论哦