TOPIC

# LLM

共 6 篇文章

ARTICLEAI 应用

长上下文压缩:在准确性、延迟和成本之间做可解释取舍

组合摘要、去重、结构化记忆和分层检索,避免把整库内容塞进上下文窗口。

ARTICLEAI 应用

LLM 评测与可观测性:把一次回答变成可回归的工程指标

建立离线数据集、在线反馈、链路追踪和成本指标,持续判断模型、提示词与检索改动是否真的变好。

ARTICLEAI 应用

大模型微调数据工程:从原始对话到可训练样本

设计样本清洗、去重、标注、分层切分和版本回放,避免微调后模型学到脏数据。

ARTICLEAI 应用

LLM 结构化输出:从 JSON Schema 到业务可用结果

解决模型输出缺字段、类型漂移和半截 JSON 问题,让 AI 结果可以直接进入业务流程。

ARTICLEAI 应用

把 15 家大模型做成后台可配置:一个 ChatClient 接口的两种方言

多模型网关的设计——OpenAI 兼容与 Anthropic 原生双协议的抽象、数据库里的密钥脱敏,以及一个"真发请求"的连通测试。

ARTICLEAI 应用

LLM 推理服务的批处理、流式输出与成本控制

以在线对话接口为例,拆解动态批处理、KV Cache、排队和流式响应的容量边界。