返回首页

长上下文

找到 5 篇关于此标签的文章

Qwen3AMD

Qwen 27B 长文本速度缩水近三分之二 — 本地玩家不信官方跑分

本周 Reddit 本地 AI 社区用户发帖,准备用 AMD R9700 跑阿里 Qwen3 系列 27B 模型,结果发现官方公布的 51.8 tokens/秒是理想条件下的数字。真正的长文本场景下,速度从 75 跌到 26。值得关心的是:本地部署 AI 大模型正从能不能跑,进入跑得稳不稳的阶段。

6d ago2 分钟
KV cacheLocalLLaMA

本地玩家发现提速诀窍:256k 长文本推理快 3 倍,但离商用还差几道坎

Reddit 上一位用户在小型模型上验证"分块缓存拼接"技巧,长文本 prefill 速度翻 3 倍且检索准确率未掉。这条帖子的真正价值是:本地长上下文推理的工程瓶颈,可能比想象中软。

Aug 222 分钟
智谱Z.ai

代号 Ox Alpha 现身 Reddit — 智谱下一代大模型疑提前曝光

Reddit 本地模型圈出现一个匿名模型 Ox Alpha,自称「我是智谱 GLM」,号称支持 100 万 token 上下文和图像视频输入。如果属实,意味着国内大模型公司在长上下文这条战线开始拿出产品级数字。

Aug 212 分钟
dots-studiodots3-note preview

280B 大模型只激活 16B — 开源模型竞争重心从'总参数'转向'激活参数'

dots-studio 这周在 Hugging Face 上线 dots3-note preview:280B 总参数的 MoE 架构,每次推理只激活 16B,支持 512K 上下文与多模态输入。这件事值得关注,是因为开源大模型的竞争重心正在从'总参数越大越好'转向'每次实际花多少算力'。

Aug 142 分钟
DeepSeekV4-Flash

DeepSeek 新模型跑长任务会突然"睡着" — 本地部署的代价开始显现

DeepSeek 最新开源模型 V4-Flash 在超过 10 万 token 的长任务中会中途停止生成,不报错、不崩溃。本地跑 AI 的人越来越多,但"能下载"和"能稳定用"之间的差距,这次有了具体证据。

Aug 92 分钟