博客
Tags
# LLM10
标签「LLM」下的文章
- 采集纠偏样本:一个埋点盲区,和「高分而自信地错」的通用叶子 约 3 分钟
拿埋点数据做 A/B 归因,得出「新功能上线后准确率掉了一大截」——被当场指出口径有问题。那个字段从头到尾只记录了其中一方的输出。
- 让模型查分类树,而不是背它——然后发现整棵子树根本塞得下 约 7 分钟
分类链路先是把菜单塞进 prompt 让模型背,然后改成给模型三个检索 tool 让它查。查准了,但要来回好几轮。最后量了一下体积:整棵子树直接给它就行。
- 把聊天里的截图喂给模型:直接传 URL,以及「文档和视频别伪装成图片」 约 5 分钟
客户发来的截图常常是唯一的故障证据。接入多模态时差点白写一整条取图链路;上线后又发现,PDF 和录屏在模型眼里全是「一张图片」——不是模型认不出,是取数层先把信息毁了。
- 用 Native Messaging 在本机跑语音转写:三道消息上限,和「搬代码要搬判据」 约 6 分钟
扩展里做语音转写,云端要每人一个 API key,浏览器内 WASM 又太慢。最后落到 Native Messaging + 本机宿主——路上撞到的每一道墙,都是消息通道的尺寸与形状。
- 服务端粗筛 + 本地精排:给一个没有模糊搜索的列表接口做相似检索 约 5 分钟
过滤器写错不报错,而是「看起来查到了全量」。在这样的接口上做相似检索,第一件事是验证你的过滤条件真的生效了。
- 先分流再匹配:一个关键词分类引擎的三次失效 约 6 分钟
三级分类树里 38% 的叶子重名,加分改变不了「同名无法区分」。于是先分流再打分——然后树被改了层级,锚点淹没了小系统,分词器切不开连写的中文。
- 给 agent 的 tool 分级:read / write / send,以及为什么 send 永远不给 LLM 约 6 分钟
把已有能力函数包成可编排的 tool 只是第一步。真正的设计在于副作用分级,以及「流程可以自主提交」和「LLM 可以自主调用提交」之间那条容易被抹平的界线。
- 固定流程 + AI 判断节点,而不是 function calling 自主决策 约 5 分钟
同一件事,写死一条链和交给模型自己编排,差别不在能力上,在于出问题时你能不能定位到是哪一步。
- 接一个 OpenAI 兼容网关的实战清单:强制流式、函数名不能含点、模型下架不报错 约 5 分钟
「OpenAI 兼容」只保证形状兼容。真正会咬你的是那些它没说、而你也不会去试的地方——包括一个模型被下架后静默路由到别的模型。
- 把 AI 助手放进 Chrome 原生 Side Panel:瘦客户端、per-tab 绑定、360px 约 5 分钟
从网页内注入面板改成浏览器级侧栏,换来的是不抢页面空间和不被宿主重建冲掉。代价是三个必须先知道的约束。