返回首页
VLM
找到 3 篇关于此标签的文章
LocalLLaMAVLM
4.5亿参数小模型看懂浏览器屏幕:1%到44%说明垂直微调更划算
Reddit 开发者用 5 万张浏览器截图微调 4.5 亿参数的视觉语言模型,屏幕问答准确率从 1% 跳到 44%。值得关心的是:Agent 落地的瓶颈可能不是参数够不够大,而是有没有针对真实界面做专项训练。
6d ago2 分钟
NVIDIAFLARE
医院、工厂的 AI 训练数据不用搬家了 — NVIDIA 把联邦学习做进多模态
联邦学习(数据不出本地、联合训练 AI)过去主要跑在结构化数据上。NVIDIA FLARE 现在支持视觉语言模型,意味着医院影像、工厂巡检图也能在不集中的前提下协同训练。这是合规行业的解药,但落地复杂度不低。
Aug 192 分钟
TomofunFurbo
Furbo 宠物摄像头换掉 GPU 改用 AWS 自研芯片 — AI 推理降本跑出真实商业案例
台湾宠物科技公司 Tomofun 将 Furbo 摄像头的 AI 推理从 GPU 迁移到 AWS 自研芯片 Inferentia2,成本显著下降且精度不损。这标志着「推理专用芯片替代 GPU」不再只是厂商叙事,有了面向消费者的真实验证。
May 72 分钟