Gemini
找到 12 篇关于此标签的文章
Google 升级 Gemini 语音到 3.8 版 — AI 念稿味儿终于要淡了
Google DeepMind 发布 Gemini 3.8 语音合成模型,焦点不在花哨新功能,而在停顿、语气、多语言的自然度。这件事值得关心:AI 语音正在跨过「能听」的门槛,逼近「想听」。
Google 把语音转文字错误率压到 2.6% — 但不是每个场景都该用
Google 本周上线 Gemini 3.5 Transcribe,把语音转文字的错误率从上一代约 7.3% 压到 2.6%。这件事值得关心,是因为会议记录、客服质检、法律取证这些场景的可靠性门槛被进一步压低。
Google 推 Gemini Omni 1.1 Flash — 卖点从'更强'换成'更可控'
Google 把轻量模型 Gemini Flash 升级到 Omni 1.1,把'开发者可控性'做主卖点。背后是行业转向:企业 AI 落地最痛的不是答不出题,而是管不住模型。
Google 把 Gemini 转录升到 3.5:语音转文字这门生意,越来越挤
Google DeepMind 上线 Gemini 3.5 Transcribe,主打更"智能"的语音转文字。在 Whisper 免费开源、Azure 占据企业市场、各家会议软件自带转录的拥挤赛道里,Google 想靠"上下文理解"再分一杯羹。
Qwen 27B 让本地 AI 追上 Gemini — 中国小模型反向超车
本周 Reddit 开发者社区传来信号:阿里通义千问 27B 参数的小模型,在 OCR 和代码任务上追平甚至超越 Google Gemini。一家美国团队正认真考虑自购硬件跑 AI,不到两个月回本。本地 AI 第一次有了可用的味道。
德意志银行把监管演练交给 AI Agent — 银行业最贵的合规开始被拆解
德意志银行用 Google Cloud 的 Gemini Agent 平台处理欧盟 DORA 法案要求的合规演练,把几周的人工桌面推演变成自动化的运营韧性平台。背后是银行业每年 2000 亿美元合规支出开始被 AI 重新切蛋糕。
AI 圈一天连发 5 件大事 — 对咱们做副业的到底有啥影响?
上周五 AI 圈 5 件大事挤在一起:OpenAI 营收破 400 亿、苹果联手阿里、国产 GLM-5.3 发布、Cursor 联姻 SpaceX、谷歌 Gemini 3.7 Flash 上线。帮非码农创业者筛出和自己有关的 1 件事。
Todoist 让 AI 听你碎碎念就建任务 — 语音终于不用先转文字了
Doist 的 Todoist 上线 Ramble 功能,用户对着手机说话,AI 实时拆解成任务列表,跳过转文字环节。值得关心的是:AI 从等你提问变成边听边干,语音优先的生产力工具可能真要来了。
Google 发布 Gemini Agent 治理指南 — 大厂竞争焦点从写 Demo 转向管基建
Google Cloud 发布 Gemini 企业级 Agent 平台及五份生产部署指南,涵盖长时任务、治理与多智能体协同。这标志着行业焦点正从跑通 Demo 转向严管基建,企业用 AI 不再只是聊天,而是要建一套带权限和审计的数字员工体系。
Mac 本地实测 10 个 AI 画图模型:文化偏见比画质更值得担心
有人在 M1 Max 上跑了 10 个本地图像生成模型,发现 Flux 写实最强但英语偏见严重,Qwen-Image 蒸馏版反而更快更好。最关键的发现是:训练数据来源比模型大小更能决定非英语内容准不准。
一个开发者想让 AI 实时看着你画画给建议——这个想法离真正可用还有多远
Reddit 上一位独立开发者公开了一个构想:把多模态大模型(能同时理解图像和语音的 AI)接入 Discord,让它实时看用户在 Blender 或 Photoshop 里的操作画面,并用语音给出反馈。这个方向值得关注,因为它触碰了 AI 辅助创作工具的一个真实痛点——创作者需要「不打断手感」的即
Reddit 社区呼吁谷歌开源 Imagen(2022)、Gemini 1.0 Nano 与 Gemini 1.0 Pro
r /LocalLLaMA 社区发帖敦促谷歌开源多款已 废弃的旧世代模型,包括 Imagen、Gemini 1.0 及 PaLM 2,谷歌方面尚无任何回应。