4B 模型 23 步挖到铁矿:不写字的 Agent 在 RTX 3090 上跑通了
相关推荐
基于 #Mica 推荐
30 美元训练的小模型把对手甩开 4 倍 — 大模型「越大越强」开始出现裂缝
独立开发者用 30 美元租显卡训练出 4B 参数的 Mica——它不写文字,只输出每个动作的概率用于决策。三个种子的方块测试中,Mica 平均清行数约为对照模型的 4 倍。重点不在游戏成绩,而在「专精小模型」挑战「通用大模型」的可能性。
Qwen 27B 在 24G 显存跑出近满血质量 — 本地化部署门槛再降
本周值得关心的是一个有趣的实验结果:Reddit 有用户用 KV Cache 移植技术,在 24G 显存的 GPU 上跑出接近 6-bit 满血精度的 Qwen 27B 输出。本地化部署大模型的硬件门槛可能比我们以为的低一截。
27B 模型在家通宵写代码 — 个人本地 AI 编程已成真事,但「怎么管」才是真问题
开发者 Jan 用两块 16GB 显卡在家跑 Qwen3 27B 开源模型,让它通宵自动写出两个监控工具。真正值得关心的不是模型本身,而是「记忆存文件、每步先验收、人随时叫停」这套协作流程。用 AI 写代码这件事,已经从大公司预算变成个人显卡能跑的事。
AI 客服搭建已有 25 章教程:从研发项目变成工程活,传统企业该重新算账
掘金一篇技术教程把智能客服 Agent 拆成 18 步:路由、RAG(让 AI 检索企业知识库作答)、工具调用、记忆、Guardrail(安全护栏)、评测全链路。值得关心的是:当这件事被模块化、标准化,过去花几百万请外包的中小企业,是不是该重新评估搭建与运维的真实成本。
本地部署 AI 算力账:8 张消费显卡打不过 4 张 — DIY 玩家撞上 PCIe 带宽墙
一位 Reddit 玩家准备把 RTX 3060 从 4 张加到 8 张,社区一边倒劝退:超过 4 卡后 token 速度不升反降。这背后是 PCIe 通道的物理瓶颈,也提醒中小企业,「自建比上云便宜」的直觉在算力规模上不成立。
苹果 M5 Ultra 跑国产大模型,改一个参数让推理速度涨两成 — 本地 AI 这次真的够用了
本周 Reddit 技术帖显示:苹果 M5 Ultra 跑国产 GLM-flash 模型时,把一个叫 prefill step 的参数从 2048 调到 8192,13 万 token 长文档总耗时直接缩短两成。这不是技术细节,而是本地大模型跨过一道隐形门槛的信号。