找到 1 篇关于此标签的文章
Reddit 开发者用 5 万张浏览器截图微调 4.5 亿参数的视觉语言模型,屏幕问答准确率从 1% 跳到 44%。值得关心的是:Agent 落地的瓶颈可能不是参数够不够大,而是有没有针对真实界面做专项训练。