top of page

Xiaomi Fold 押注灵感球,但 AI 交互仍需证明自己

Xiaomi 于 9 月 2 日将即将推出的 Xiaomi Fold 旗舰机与一项新的 AI 控制功能关联起来,前一天该公司刚刚预览了这款手机的设计。这项名为灵感球的功能结合了拖拽手势与语音指令。Xiaomi 表示,它能够识别用户选中的屏幕内容,并完成与之相关的任务。

这项公告属于产品预告,而非独立演示或完整评测。Xiaomi 尚未公布该功能在准确率、延迟、应用兼容性或失败率方面的详细数据。其 9 月开启的测试版推送也意味着,宣传材料中展示的体验可能与早期用户实际获得的版本有所不同。

这一验证缺口很重要,因为 Xiaomi 并非在一个空白市场中引入具备屏幕感知能力的 AI。Google、Samsung、Apple 和 Honor 已经提供了选择、理解、搜索或针对可见内容执行操作的方式。Xiaomi 更强的主张在于:一个手势即可将精确选择与系统级执行连接起来。

Xiaomi 18 Fold 的更大屏幕为这一理念提供了合适的展示场景。折叠设备可以同时显示更密集的页面、多个面板和更多对象。但这些优势也带来了更棘手的识别问题,尤其是当助手必须区分彼此相邻的地址、商品、照片或日历详情时。

因此,Xiaomi 面临的考验远比再推出一个 AI 快捷方式更关键。灵感球必须证明,上下文敏感的执行操作比熟悉的屏幕搜索更有用,同时又不能引入过多错误或操作阻力,以至于用户重新退回到普通触控操作。

Xiaomi 实际为其折叠设备公布了什么

已获确认的事件是 9 月 2 日的交互预览,而灵感球这一底层功能此前已随 HyperOS 4 发布。

根据 9 月 2 日的一则产品预览,Xiaomi 创始人、董事长兼 CEO 雷军展示了 Xiaomi 18 Fold 使用灵感球的过程。该帖子描述了一种拖拽操作:先识别文本或图像,再通过语音请求触发更复杂的操作。

这确定了热榜条目背后的日期。Coolapk 的列表在雷军 9 月 2 日的帖子发布后出现,但它并未提供经过独立验证的时间戳或更多技术证据。它应被理解为一种聚合信号,而不是公告的源头。

该功能本身早于这款手机的预告。Xiaomi 此前已将灵感球作为 HyperOS 4 中 Super XiaoAi 2.0 的一部分进行介绍。其官方 HyperOS 4 页面列出了四项示例操作:根据地址打开导航、寻找相似商品、创建日历条目,以及编辑照片中选定的部分。

在每个示例中,用户都会先指明一个可见对象,随后再通过语音指令告诉助手希望得到什么结果。该界面应当同时解决两个不同的问题:用户所说的“这个”具体指什么,以及手机应对此执行什么操作。

这一区分很重要。传统语音助手经常在屏幕上出现多个相关对象时遇到困难。如果一条消息包含两个地址,“导航到这里”这样的指令就会变得模糊。当一张海报包含多个日期或地点时,“把这个添加到我的日历”也可能失败。

灵感球试图通过指向来消除这种歧义。Xiaomi 将这项控制功能描述为一种让 Super XiaoAi 准确看到用户所指位置的方式。该公司称,这能缩短此前需要经历屏幕识别、手动选择和单独发出指令的操作流程。

Xiaomi 的官方说明还补充了若干限制。灵感球预计将通过 9 月的空中更新提供,也就是直接向兼容设备推送的软件更新。该选项默认关闭,必须在系统导航设置中手动启用。

该公司还表示,结果可能因设备型号和软件版本而异。Super XiaoAi 2.0 功能需要足够新的助手版本,而一些高级功能仅支持特定设备。这些限定意味着,不能把演示视为其普遍可用性的证明。

9 月 2 日的预告将这一软件叙事与 Xiaomi 18 Fold 联系起来。Xiaomi 将这款书本式折叠设备定位于其数字旗舰产品家族中。该公司称,该机型并不只是另一种次要形态,但在交互预览发布时,完整的发布细节仍有待公布。

这一时机使软件关联具有战略意义。硬件规格很容易被竞争对手比较。持续存在的系统级交互则更难复制,因为它依赖操作系统访问权限、助手模型、应用连接,以及可靠的意图识别。

因此,这项公告改变了 Xiaomi Fold 的叙事。该手机不再仅被宣传为一款更薄或更精致的折叠设备。Xiaomi 正将其呈现为一个 AI 界面的试验场,而这一界面未来可能会在其更广泛的硬件产品组合中发挥作用。

为什么 Xiaomi Fold 是屏幕感知 AI 的严苛考场

折叠设备能为灵感球提供更多有用的上下文,但也为助手误解用户提供了更多可能。

更大的内部显示屏可以容纳比传统手机屏幕更多的信息。用户可以把商品与消息并排比较、将行程与地图一同查看,或在通讯应用旁保持文档打开。这种信息密度让上下文选择更具价值。

但它也会增加歧义。一个旅行页面可能同时包含酒店地址、机场位置、餐厅推荐和多个日期。购物界面可能展示多张颜色相近的商品图片。日历视图则可能包含重叠的个人与工作事件。

Xiaomi 提出的交互方式通过将空间输入与语言结合来应对这一问题。拖拽手势提供目标,语音则补充预期操作。两者共同构成多模态指令,即通过不止一种输入方式表达的请求。

设想一份会议邀请显示在聊天内容旁。用户可以指向一个具体日期,并要求手机将其添加到日历中。一个实用的实现方式需要提取正确时间、识别适用时区、避免选中附近文本,并在保存前提供审阅步骤。

导航则带来了另一种严苛场景。一条消息可能提及会议地点及之后的晚餐地点。指向操作能够澄清哪个地址更重要,但系统仍需要识别文本、解析地点、打开合适的地图服务,并保留原始任务上下文。

图像编辑带来了更多不确定性。Xiaomi 展示了用户指向照片中的某一部分并请求修改的场景。这一操作需要准确的分割能力,即从周围像素中分离出目标主体。它还需要生成式模型理解所请求的编辑内容。

一个令人信服的界面不能只是产出结果。它还必须让错误易于发现和撤销。如果助手选错了对象,用户需要一条明确的纠正路径。如果它提出涉及通信、导航或日程安排的操作,用户则需要清晰的确认步骤。

折叠屏也引出了窗口边界的问题。Xiaomi 尚未详细说明灵感球在分屏应用、悬浮窗口、受保护内容或工作配置文件中的表现。这些情况将决定该功能究竟像一个系统界面,还是仅限于理想条件下的精致演示。

折叠设备历来承诺提供接近桌面级的生产力,却并不总能达到桌面环境的可预测性。硬件可以显示多个工作空间,但不同应用在调整大小、拖放和跨窗口操作方面的支持仍存在差异。AI 层也会继承这些不一致之处。

Xiaomi 在将助手连接至更广泛设备组合方面已有经验。在此前的一份公司文件中,Xiaomi 描述了 Super XiaoAi 如何结合云端和端侧模型,以及屏幕感知和跨设备执行能力。该文件还将光学字符识别、自然语言处理、记忆和操作框架列为这一方法的组成部分。

然而,架构描述并不能证明每一种工作流都能可靠运行。Xiaomi 18 Fold 将这一界面置于一个尤其不容出错的环境中。购买高端折叠设备的人会期待多任务和生产力功能能够稳定工作,而不仅是在受控演示中表现良好。

因此,这款手机是一项有价值的压力测试。如果灵感球能够理解信息密集的折叠屏布局、在应用之间交接任务,并在不确定时优雅恢复,Xiaomi 就将拥有一个有意义的界面叙事。若做不到,更大的显示屏只会更快暴露这些弱点。

从理论上看,灵感球超越了 Circle to Search

主要竞争并非 Xiaomi 与某一个手机品牌之间的较量,而是面向操作的 AI 与既有的“选择内容并获得信息”模式之间的竞争。

Google 于 2024 年 1 月推出 Circle to Search,作为一种无需离开当前应用即可搜索可见内容的方式。用户可以圈选、高亮、涂画或轻点一个对象。Google 最初在 Pixel 8 系列和 Samsung Galaxy S24 产品家族上推出该功能。

最初的 Circle to Search体验侧重于识别和发现。它可以寻找相似商品、解释不熟悉的物品,或将图像与书面问题结合起来。其核心承诺是低阻力搜索,而非广泛的系统执行。

灵感球同样始于一个相关洞见:屏幕内容本就是用户查询的一部分,因此强迫用户用文字描述一切并不高效。两种界面都允许用户在当前任务中通过空间方式标识对象。

Xiaomi 所主张的是不同的终点。Super XiaoAi 不应在搜索或解释后停下,而是应将选中的信息带入一个操作之中。示例包括打开导航、创建事件、寻找商品以及修改图像。

这一变化听起来不大,却改变了风险特征。错误的搜索结果通常只是带来不便。错误的日历事件、路线、消息、购买选择或照片编辑,则可能产生超出助手界面的后果。

执行操作也需要更深层的整合。搜索往往可以基于截图或选定区域进行。完成一项任务则需要权限、应用接口、结构化数据、状态管理和确认逻辑。助手既必须知道用户选择了什么,也必须知道每个目标应用能够接收什么。

Apple 正从另一条路径沿着同样的方向推进。其视觉智能可以分析屏幕内容、搜索相似物品、回答问题、识别联系信息,并根据可见详情创建日历事件。

Apple 的方案采用用户熟悉的硬件控制方式,并以截图作为屏幕内容分析的入口。小米的拖拽加语音设计在屏幕上存在多个可能目标时显得更直接。它要求用户在一次连续交互中指向对象,同时表达期望的结果。

两种方案都不会天然胜出。硬件按键在用户了解其用途后易于发现,而边缘手势可能与既有导航习惯冲突。基于截图的分析会生成一个用户易于理解的明确产物。悬浮控件或许感觉更快,但其权限范围和数据边界可能不那么直观。

真正的比较在于交互成本。一项新控件只有在减少的操作多于新增操作时才算成功。用户必须记住如何调用它、等待识别、检查建议操作、纠正错误,并判断是否适合当众说话。

语音并非总是方便。在会议、公共交通工具上,或处理机密信息时,它可能令人尴尬。小米尚未说明“灵感球”的每项操作是否都支持文字指令、语音处理是否留在设备端,以及界面如何处理敏感的企业应用。

折叠屏形态让这些问题更为重要。更大的显示屏会鼓励用户处理文档、通信内容和私密账户信息。在这样的环境中运行、且具备屏幕感知能力的 AI,需要明确的权限边界和可预测的排除规则。

小米在概念上的优势是精准。指向与语音的结合提供的信息,比通用助手调用方式更多。其实际劣势则是复杂性。更多输入、更多可能操作和更多应用,也意味着更多出错机会。

因此,从纸面上看,“灵感球”优于 Circle to Search,因为它承诺的是执行而非检索。测试版必须证明,这一雄心能否经受真实界面、不同口音、杂乱布局,以及从未为 AI 控制而设计的应用的考验。

承诺仍领先于现有证据

小米展示了一个连贯的交互理念,但尚未提供足以证明该交互可靠的证据。

最直接的不确定性是识别准确率。小米称该界面能够精准识别文字和图像,但尚未公布测量方法。对于拥挤屏幕、小型目标、风格化文字、混合语言或部分被遮挡对象,尚无经过验证的成功率数据。

延迟同样重要。只有响应足够迅速、能够保持用户的思路连贯,手势才会显得自然。如果内容识别、语音处理、规划和应用执行需要经历多次独立等待,这条捷径可能反而比手动操作更慢。

9 月测试版的状态确认,该系统仍在积极评估中。测试软件可能暴露设备型号、应用、账户设置和区域服务之间意料之外的冲突。小米自身的兼容性说明也警告,结果可能因型号和软件版本而异。

默认关闭的设置也是一个有意义的信号。用户必须在导航选项中启用“灵感球”。这种方式可限制不必要的手势冲突,但也削弱了功能的可发现性。许多用户从不更改隐藏的系统导航控制项,尤其是在好处并不立刻显而易见时。

侧边手势也可能与 Android 导航竞争。小米表示,该控件利用边缘滑动时的短暂停顿。这种交互必须可靠地区分 AI 请求与常规返回手势。误触会令人烦躁,而无法触发则会让功能显得不可靠。

应用支持带来了更深层的问题。创建日历条目可以使用结构化的操作系统功能。编辑图像或安排多阶段任务,则可能依赖小米应用、兼容的第三方服务,或面向助手的自动化接口。

该公司尚未公布完整的支持列表。目前仍不清楚哪些操作可在整个 HyperOS 中运行,哪些需要小米自家应用,以及哪些依赖仅在中国大陆提供的服务。这些边界将决定该功能对国际市场小米用户的实际意义。

隐私文档也需要更高的可见度。指向屏幕内容可能暴露消息、文档、账号、照片或工作场所信息。用户需要知道哪些内容在本地处理、哪些会发送至云服务、数据保留多久,以及是否有第三方模型参与。

相比之下,Apple 公开说明,许多 Apple Intelligence 操作使用设备端处理。它表示,需要更大算力的请求可使用其 Private Cloud Compute 基础设施。Apple 还提醒,生成结果可能有所差异,重要信息应当核实。

小米早期材料描述了设备端与云端模型资源,但“灵感球”页面并未将各项操作对应到具体处理路径。导航请求与复杂图像编辑很可能有不同要求。用户需要在关键时刻看到这种区别。

执行错误尤其值得关注。能够识别正确地址、却选择错误地图服务的助手,只能算部分成功。遗漏时区的日历操作,则可能创建一个看似有效却不正确的事件。

因此,界面应在执行具有后果的操作前展示其理解结果。预览卡片可以显示选中的内容、目标应用、提取字段和请求操作。用户应能在不重启流程的情况下更正任一元素。

小米还需要展示优雅的失败处理方式。当助手无法识别对象或完成操作时,应明确说明。虚构的确定性会比拒绝更糟,尤其当结果影响预约、文件、通信或购买时。

早期用户报告将比宣传视频更重要。评测者应测试混合语言屏幕、密集的购物页面、分屏工作流、小型界面目标、较差网络条件,以及小米精选示例之外的应用。

在这些结果出现之前,最好将“灵感球”理解为一个有前景的界面假设。它尚未被独立验证为可可靠替代现有触控操作序列、语音助手或屏幕搜索控件的方案。

为什么手机厂商正竞相转向面向行动的 AI

智能手机 AI 竞争正从生成答案,转向控制日常任务已发生其中的界面。

大语言模型让对话式助手更灵活,但单靠对话无法解决智能手机交互问题。用户往往希望在应用内获得结果:保存一个日期、打开一条路线、修改一张图像,或在服务之间转移信息。

屏幕感知为助手提供了即时上下文。系统无需让用户复制文字、描述图像或切换应用,而是可以检查屏幕上已经可见的内容。空间选择则可进一步将上下文缩小到特定对象。

Google 通过 Circle to Search 大规模确立了这种交互模式。在 Google I/O 2024 上,该公司表示,这项功能已在超过 1 亿台设备上可用,预计将在年底前将覆盖范围翻倍。这些数字描述的是早期扩张阶段,并非其当前装机量。

这种分发让 Android 用户认识到,选择屏幕上的任何内容都可以调用 AI 辅助搜索。小米不必从零开始引入这一底层概念,但需要说服用户:不同的手势和助手可以带来更有用的结果。

Apple 对屏幕视觉智能的开发也施加了类似压力。其界面可以识别屏幕内容、在启用时将问题发送给 ChatGPT、查找相关产品、总结材料并提取日历信息。手机厂商正趋向于将屏幕本身视为 AI 输入界面。

这种竞争改变了差异化的定义。获得一个有能力的模型已不再足够。厂商需要交互设计、操作系统权限、应用集成和信任控制,才能将模型输出转化为可靠行动。

小米有一个结构性理由去追求这一方向。其设备覆盖手机、平板、电脑、可穿戴设备、家居产品和汽车。能够理解上下文并分派操作的系统助手,或许比一组彼此独立的应用界面更能有效连接这些品类。

Super XiaoAi 2.0 被定位为协调层。小米称,高级模式可跨应用或设备规划并执行更复杂的任务。“灵感球”则提供了一种更精准的方式,为这些任务定义起始对象。

Xiaomi 18 Fold 为这一策略提供了一个醒目的旗舰载体。折叠屏买家本就被要求接受陌生的物理形态。与普通手机用户相比,他们更可能尝试多任务处理、新手势和面向生产力的控制方式。

这一受众也很挑剔。高端设备不能长期依赖新鲜感。用户会将 Xiaomi Fold 与 Samsung、Honor、Google、Oppo 及其他厂商成熟的折叠屏产品比较。当硬件差异缩小时,软件可靠性可能成为决定性因素。

因此,主要压力落在那些并未控制同等集成助手层的 Android 厂商身上。Google 可以在 Android 生态中分发 Gemini 和 Circle to Search,但每家手机厂商都必须决定,要自行构建、定制多少体验,或将多少交给 Google。

小米的选择是让 Super XiaoAi 成为设备身份的一部分。如果“灵感球”运行良好,公司将获得一种引导用户使用小米服务和跨设备功能的交互方式。如果它表现不佳,Google 更熟悉的控件仍是更容易的后备选项。

这就是该功能的重要性超越单一折叠屏产品的原因。它代表着一次尝试:掌握用户看到信息与据此行动之间的时刻。这个时刻正成为每个移动操作系统和助手提供商都在争夺的宝贵领域。

三个信号将决定“灵感球”是否重要

下一阶段取决于可衡量的行为,而非更多宣传示例。

第一个信号是小米 9 月的测试版推送。仅仅提供功能并不能验证它。关键证据将来自用户能否稳定触发它,并复现宣传中的导航、购物、日历和图像编辑工作流。

评测者应测试日常屏幕,而不是小米的演示内容。有用的案例包括:含有多个地址的聊天、带有多个日期的海报、包含相似商品的购物页面,以及主体相互重叠的照片。

如果“灵感球”能在这些场景中识别预期目标,小米关于精准性的论点就会更有力。即使底层 Super XiaoAi 模型在接收到正确输入后表现良好,频繁的选择错误仍会削弱其核心主张。

第二个信号是应用和设备支持矩阵。小米应明确哪些手机会获得该功能、哪些功能需要 Super XiaoAi 2.0,以及哪些操作可在第三方应用中运行。

区域可用性将至关重要。官方 HyperOS 4 材料包含多项中国特定的限定,而小米在许多市场销售手机。与本地应用或服务紧密绑定的功能,无法自动成为 Xiaomi Fold 的全球优势。

更广泛的支持将表明,Inspiration Ball 具备操作系统级能力。有限的支持则会让它更接近一个围绕部分 Xiaomi 应用和受控使用场景打造的演示层。

第三个信号体现在可见的确认机制和恢复设计上。用户应当能够看到助手选中了什么、理解了什么,以及准备执行什么操作。具有重要影响的操作在执行前应始终可供审核。

这一信号将揭示 Xiaomi 是否将不确定性视为 AI 系统的常态属性。值得信赖的设计不会掩盖模糊性,而是让用户能够快速更正所选对象、编辑提取的信息、取消操作,或返回上一状态。

强大的恢复控制将进一步支撑 Xiaomi 关于 Inspiration Ball 已适合日常工作的说法。无论成功演示看起来多么令人印象深刻,如果界面在没有清晰预览的情况下直接提交操作,这一论点都会被削弱。

这三项测试也为潜在买家提供了实用的评估框架。观察 beta 版本在拥挤屏幕上的准确性;确认你所使用的应用和地区是否获得支持;然后检验手机会以多大便利程度展示并纠正错误的理解。

Xiaomi Fold 并不需要完美的 AI,才能让 Inspiration Ball 变得实用。它需要的是可预测的边界。用户可以接受一项清楚说明自己能做什么、不能做什么的功能;但对于一个表现难以预测、却以同等自信呈现每项输出的功能,用户最终会放弃使用。

Xiaomi 在 9 月 2 日发布的预告,为 Xiaomi 18 Fold 确立了一个雄心勃勃的方向。该公司希望通过一次组合手势和语音请求,让设备将可见信息转化为行动。

这一构想具备可信度,因为其组成模块已存在于现代智能手机之中。屏幕识别、视觉选择、语音指令、图像编辑和结构化应用操作,都是成熟能力。更困难的任务,是在不增加不确定性的前提下将它们整合起来。

当 beta 版本上线后,这种整合才是读者应当评判的重点。请在那些定义真实工作的杂乱屏幕上试用该功能,而不只是观看干净的产品演示。如果它既能节省时间,又能让用户始终掌握控制权,Xiaomi 构建的就不只是又一个 AI 快捷功能。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page