返回首页

LLM

找到 16 篇关于此标签的文章

NVIDIADynamo

NVIDIA 让大模型服务崩了后几秒就恢复 — 但前提是用它的卡

NVIDIA 给自家推理框架 Dynamo 加上「影子引擎恢复」:单个推理节点崩溃后,恢复时间从几分钟压到几秒。对正在把 AI 部署到生产线的传统企业,这是一则好消息,也是一则关于算力绑定的提醒。

4d ago2 分钟
AQuA量化交易

两个 AI 互相审交易代码都漏掉一个 bug — 解法是给 AI 上锁

一个量化交易实验记录了 AI 自审系统的翻车:两个 AI 都批准了一个含未来数据的特征。论文给出的解法不是让审稿 AI 更聪明,而是限制 AI 能调用的操作范围。

5d ago2 分钟
LLMRLHF

AI 满嘴'minted''escape hatch':硅谷腔病有解药

Reddit r/LocalLLaMA 这周出现一则高赞吐槽:用户列举 LLM 用'minted'替代'created'等怪现象。编辑部研究为什么 AI 学会装腔作势,给出几条实用解药。

Aug 222 分钟
Jeremy MorrellSimon Willison

LLM 让软件变成乐高 — 开发者 Morrell:让用户自己写插件的时代来了

独立开发者 Jeremy Morrell 提出新假设:LLM 把写扩展的成本压到几乎为零,沙箱技术解决安全问题,软件未来可能只剩「靠谱核心」+ 用户用 AI 自由扩展。这对 SaaS 厂商的护城河和职场工具选型意味着什么?

Aug 202 分钟
Forge AdminLLM

AI 写代码提效 10 倍是真的,但前提是规矩得先定死

一个开源企业级框架作者把 LLM 接入后台代码生成,把样板流程效率做到 10 倍 — 但他自己说,真正干活的是模板不是 AI。这个边界判断,对所有想用 AI 提效的业务团队都值得读。

Aug 172 分钟
Simon WillisonDoug Turnbull

1856 个标签塞不进提示词?工程师的解法:让 AI 先'瞎编'再向量匹配

当你的标签库大到塞不进提示词,传统的'让 AI 从词表里挑'就行不通了。Doug Turnbull 的思路是让模型自由生成标签,再用向量嵌入匹配回现有词表。这反映了一种更普遍的分工:让 LLM 做它擅长的,让向量检索做约束。

Aug 152 分钟
KubernetesLLM

AI 服务'活着'却返回空格和乱码,传统监控在 LLM 时代集体失明

上周一个生产事故暴露了 LLM 应用的监控盲区:HTTP 全部 200,但 AI 助手开始悄悄返回空字符串。文章给出三层健康检查体系的工程实践。

Aug 132 分钟
Revision PromptingLLM

工业 LLM 找了个新窍门:让 AI 自己改自己的作业 — 学术圈开始认真研究「审稿机制」

这是 2026 年初 AI 学术界一个默默升温的方向:把学术论文「同行评审」那套逻辑搬进工业级大模型流程,让 LLM 互相审稿、迭代改稿。值得关心的是——大模型推理成本居高不下的当下,「让 AI 自己复盘」可能比堆参数更省钱。

Aug 92 分钟
DeepSeekToken

1M token 不是“无限记忆”:大模型真正稀缺的是上下文预算

DeepSeek 这类模型已把上下文窗口做到 1M token,但这不等于 AI 真能“记住一切”。值得我们关心的是,token 不只是计费单位,它决定了模型能看多少、记多久、成本有多高,也决定了企业做 AI 应用时的真实边界。

Jun 212 分钟
LLM智能客服

一周做出 AI 客服原型不难,难的是把“会聊天”变成可交付系统

一篇开发实战文章讲清了 AI 客服的真实门槛:不是接上大模型就够,而是要补齐会话管理、状态机和审计这些工程层能力。值得关心的是,企业买到的往往不是“更聪明的机器人”,而是一套更可控的服务流程。

Jun 132 分钟
RedditLocalLLaMA

一条 Reddit 提问引出真实信号:非大模型 AI 正在回到日常工具位

Reddit 上一条关于“每天真正在用的非大模型 AI 工具”的讨论,暴露出一个值得关心的变化:市场注意力还在追逐聊天机器人,但真正稳定进入工作流的,往往是语音、推荐、识别和自动化这类不显眼的 AI。

Jun 72 分钟
LLMDatadog

调用量从千次涨到十万次后,AI 应用先卡住的往往不是模型而是限流

当日调用量从 1000 涨到 10 万、429 报错率从 0.1% 升到 8%,这篇工程实战提醒我们:大模型应用真正先出问题的,常常不是模型能力,而是流量治理、配额分配和排队机制。

Jun 52 分钟
OpenAIClaude

大模型开始展示思考草稿 — 黑箱透明化正从卖点变成标配

大模型开始把推理过程(Chain of Thought)直接展示给用户看。这不仅仅是技术秀,更是解决信任问题的解药,正在重塑人机交互的标准。

May 52 分钟
AI优化本地部署

斯坦福Meta-Harness:AI系统自我进化,本地部署成本再降四倍

AI运行框架首次实现自动优化纠错,同等任务消耗算力降至四分之一,本地AI部署成本结构正在重写。

Apr 102 分钟
LLMSimon Willison

simon-willison-llm-library-abstraction-layer-redesign

Willison 使用 Claude Code 对 Anthropic、OpenAI、Gemini 和 Mistral 的 API 进行逆向工程,重建 LLM 的插件抽象层。

Apr 92 分钟
MetaAI Agents

Meta 如何构建预计算引擎为 AI 代理绘制代码库地图

Meta 部署了 50 多个专用 AI 代理,将 4100 多个文件中的隐性知识编码化,使代理工具调用次数减少 40%。

Apr 62 分钟