11月14日,小米正式发布了其智能家居未来探索方案——Xiaomi Miloco(全称Xiaomi Local Copilot),旨在通过大模型技术彻底重构全屋智能体验。作为该方案的核心,小米同步在Hugging Face与GitHub开源了其自研的7B参数视觉语言多模态大模型“Xiaomi-MiMo-VL-Miloco-7B”及其GGUF量化版本,为开发者和极客用户提供了灵活的部署选项。

该模型具备强大的“感知+理解”能力,能够通过米家摄像头等设备实时识别用户的活动场景(如游戏、健身、阅读)以及特定手势(如胜利手势、大拇指),并在此基础上主动联动灯光、空调、音乐等智能家居设备,实现无需预设规则的动态智能响应。用户甚至可以通过自然语言指令,例如“读书时开台灯和音乐”,来设置复杂的智能场景,系统将依托端侧模型进行推理并自动执行。
为了确保用户隐私和数据安全,Miloco方案强调本地化部署。开源的模型采用非商用许可协议,用户可以在配备NVIDIA GPU与Docker环境的Windows或Linux主机上一键部署,将智能中枢完全掌控在自己手中。此举不仅打破了传统智能家居“规则预设固化”与“生态协同不足”的制约,也为大模型技术在家庭场景中的深度应用提供了新思路。
值得注意的是,Xiaomi Miloco当前以音视频多模态为核心,但其技术蓝图更为宏大。小米表示,未来将进一步整合毫米波雷达、化学传感器、ToF摄像头等多种感知单元,以实现对呼吸节律、空气质量、家具材质等更细微物理信号的感知,最终将近10亿台米家IoT设备无缝接入这一由大模型驱动的智能中枢。这一开源举措,标志着小米正从硬件生态向“AI+IoT”深度融合的智能生态加速迈进。