Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

1 Commit
 
 
 
 

Repository files navigation

MAIP - Mobile App Interop Protocol

让手机成为真正的智能助手,而不是一堆独立app的集合


核心想法

问题

今天的手机有一个根本性的矛盾:

  • 📱 手机上有几十上百个app
  • 🏝️ 每个app都是独立的孤岛,各自为政
  • 👴 老人记不住复杂的操作步骤
  • 🦯 盲人无法使用大部分app的UI
  • 🔄 无法跨app自动化日常任务

这不是手机应该有的样子。

愿景:手机的终极形态

想象一个世界,在那里:

  • 你不需要打开app,只需要说出你想做什么
  • 系统自动理解你的意图,调用正确的app完成任务
  • 盲人可以像健全人一样使用所有功能
  • 老人不需要学习,直接对话就能完成操作

这才是手机发展的终态。


说明

本文档描述的是MAIP整个系统的愿景和使用场景,包括:

  • 应用层:AI Agent、自然语言理解、用户交互
  • 协议层:MAIP协议(数据格式、通信机制、鉴权)
  • 系统层:操作系统IPC、权限管理

如果你想了解MAIP协议的技术规范,请阅读 PROTOCOL.md

本文档聚焦于"为什么需要"和"能做什么",而不是"如何实现"。


现有技术的启发

车机导航:已经接近理想形态

司机:"导航到北京南站"
车机:[理解意图] → [打开地图] → [开始导航]

为什么好用?

  • ✅ 不需要点击屏幕(开车时不能看手机)
  • ✅ 说一句话就完成
  • ✅ 无需学习复杂操作

但这只是一个app(地图),我们需要把这个体验扩展到所有app。

其他已有的尝试

Siri/Google Assistant:

  • ✅ 自然语言交互
  • ❌ 只能调用系统功能和少数大厂app
  • ❌ 第三方app支持很有限

智能音箱(小爱、天猫精灵):

  • ✅ 语音控制
  • ❌ 封闭生态,能做的事情有限

无障碍模式:

  • ✅ 屏幕朗读
  • ❌ 仍然需要学习每个app的UI结构
  • ❌ 复杂app基本不可用

我们需要一个统一的协议,让所有app都能像车机导航一样简单好用。


三大核心机制

1. App主动暴露能力

每个app声明自己能做什么:

  • 美团:点外卖、订酒店、叫跑腿...
  • 微信:发消息、打电话、发朋友圈...
  • 京东:搜索商品、下单、查物流...
  • 医院app:挂号、查报告、在线问诊...

标准化的能力描述,让系统知道找谁干什么。

2. 无UI调用方式

不需要打开app界面,直接调用功能:

  • 用户说"点个外卖" → 系统直接调用美团的点餐功能
  • 不需要打开app、滑动菜单、点击按钮
  • 纯数据交互,不依赖UI

UI是为人眼设计的,机器不需要UI。

3. 智能Agent控制

手机内置统一的智能Agent:

  • 理解自然语言("我要吃麻辣烫")
  • 自动路由到正确的app
  • 处理授权和权限
  • 组合多个app完成任务

一个助手,控制所有app。


核心创新:生物识别授权

传统方式的问题

点击授权在语音交互场景下不合适:

  • 盲人看不到授权界面
  • 开车时不能看手机点击按钮
  • 对话中突然要点屏幕很别扭

解决方案:声纹和人脸识别

声纹识别(无感授权)

用户:"帮我点个外卖"
系统:[在说话时自动完成声纹验证]
系统:"好的,正在下单..."

人脸识别(快速授权)

用户:"帮我转账500元"
系统:"请看向屏幕"
用户:[看一眼,1秒完成]
系统:"转账成功"

动态口令(高安全)

系统:"请说:确认转账5000元"
用户:"确认转账5000元"
系统:[同时验证声纹和内容]

风险自适应

  • 点外卖(50元) → 声纹即可
  • 购物(500元) → 声纹或人脸
  • 转账(5000元) → 声纹+人脸

使用场景

场景1:点外卖、购物

点外卖

用户:"我要吃麻辣烫"
系统:"附近的张亮麻辣烫,人均35元,评分4.8,可以吗?"
用户:"好的"
系统:"要加什么配菜?"
用户:"土豆、金针菇、青菜"
系统:"总共38元,送餐地址是公司吗?"
用户:"对"
系统:"请说:确认下单38元"
用户:"确认下单38元" [声纹验证]
系统:"订单成功,40分钟送达"

传统方式: 打开app → 搜索 → 选店 → 点菜单 → 勾选 → 结算 → 确认地址 → 支付(10+步)

MAIP方式: 说几句话,完成


网上购物

用户:"我要买洗发水"
系统:"在京东找到3个结果:
  1号:海飞丝去屑,500ml,39.9元
  2号:清扬男士,750ml,49.9元
  3号:潘婷修护,400ml,35.8元"
用户:"买1号"
系统:"海飞丝去屑洗发水,39.9元,明天送达,确认吗?"
用户:"确认"
系统:"请看屏幕" [人脸识别]
系统:"订单成功,明天上午送达"

盲人也能轻松网购,不需要看商品图片。


场景2:残障人士使用

盲人打微信

王明(盲人):"打微信电话给张三"
系统:"正在呼叫张三..." [声纹验证]
[微信视频接通]
张三:"喂,王明!"
王明:"在吗?晚上一起吃饭..."

改变:

  • 现在:盲人需要摸索屏幕,点击多次才能找到联系人,操作困难
  • MAIP:直接说名字就能打电话,和健全人一样方便

瘫痪患者

[只能说话,无法动手]
患者:"帮我给妈妈发消息:我很好"
系统:[声纹验证] → "消息已发送给妈妈"

患者:"打开电视"
系统:[控制智能电视打开]

患者:"我渴了"
系统:"要帮您叫护工吗?"
患者:"是的" → "已通知护工"

让失去行动能力的人也能独立生活。


场景3:医院挂号

用户:"我要挂协和医院心内科的号"
系统:"本周五下午2点有专家号,张医生,200元,可以吗?"
用户:"可以"
系统:"请说:确认挂号200元"
用户:"确认挂号200元" [声纹验证]
系统:"挂号成功,周五下午2点,已加入日历"

[就诊后查报告]
用户:"我要看上次的检查报告"
系统:"上周的血常规报告吗?"
用户:"对"
系统:[显示报告] "各项指标正常,医生备注:1个月后复查"
用户:"帮我预约复查"
系统:"已预约,下月同一时间,王医生"

传统方式: 打开app → 登录 → 选医院 → 选科室 → 选医生 → 选时间 → 支付(9步)

MAIP方式: 一句话搞定挂号、查报告、预约复诊


场景4:老人打微信视频

李奶奶:"给小明打视频"
系统:"正在呼叫李小明..." [声纹验证]
[微信视频自动接通]
小明:"奶奶好!"
李奶奶:"小明啊,最近怎么样..."

传统方式: 找app → 打开 → 找聊天记录 → 点进去 → 找视频按钮 → 点击(6步,对老人很难)

MAIP方式: 一句话"给小明打视频",奶奶只需记住孙子名字


核心价值

人机交互的范式转变

维度 传统方式 MAIP方式 意义
交互方式 点击UI 自然语言 回归人类最自然的沟通方式
学习成本 每个app都要学 零学习 技术适应人,而非人适应技术
操作步骤 10+步 一句话 从"操作工具"到"表达意图"
认知负担 记住按钮位置 说出想法 降低认知门槛
双手占用 必须用手 完全解放 真正的随时随地
授权方式 输入密码 声纹/人脸 安全与便捷的统一
跨app操作 手动切换 自动组合 从"功能"到"任务"

带来的改变

1. 消除技术使用的门槛

  • 不需要学习复杂的界面
  • 不需要记忆操作流程
  • 不需要适应不同app的逻辑
  • 让科技真正为所有人服务,而不是只服务于年轻人和技术熟练者

2. 解放人的注意力和双手

  • 开车时不需要冒险看手机
  • 做饭时不需要停下来擦手
  • 抱着孩子时不需要腾出手
  • 让人专注于当下,而不是操作设备

3. 提升效率和体验

  • 10步操作变成一句话
  • 多个app切换变成自动组合
  • 输入密码变成看一眼、说一句
  • 从"使用工具"到"实现意图"

4. 重新定义包容性

  • 视力不好的人不再被排除
  • 手脚不便的人不再被限制
  • 学习能力弱的人不再被落下
  • 科技不应该制造障碍,而应该消除障碍

核心能力

自然语言交互

  • 说话代替点击
  • 意图表达代替步骤记忆
  • 像和人对话一样操作手机

跨app能力组合

  • 一个助手控制所有app
  • 自动组合多个app完成任务
  • 从操作功能到完成任务

生物识别授权

  • 声纹/人脸代替密码
  • 无感验证,不打断体验
  • 安全与便捷的完美平衡

智能理解与引导

  • 理解模糊的意图
  • 主动引导补充信息
  • 从"精确指令"到"自然表达"

为什么说这是终态

1. 自然

人类最自然的交互方式是语言,不是点击屏幕。

  • 婴儿学会说话,不需要学会点击
  • 人类交流了几千年,都是用语言

2. 包容

所有人都能平等使用科技:

  • 盲人不因为看不见而被排除
  • 老人不因为学不会而放弃
  • 残障人士不因为动不了而失去独立

3. 高效

一句话完成,比点10次屏幕快得多。

4. 安全

  • 开车时不看手机
  • 生物识别比密码更难伪造

5. 延续已有趋势

  • 车机导航已经证明了语音交互的优越性
  • 智能音箱让家里的设备可以语音控制
  • 手机应该是下一个

与现有技术的区别

vs. Siri / Google Assistant

  • ❌ 现有:只能调用有限功能和少数大厂app
  • ✅ MAIP:所有app都可以接入

vs. 车机导航

  • ✅ 现有:地图导航体验很好
  • ✅ MAIP:把这个体验扩展到所有app

vs. 无障碍模式

  • ❌ 现有:屏幕朗读,仍然要学习UI结构
  • ✅ MAIP:直接对话,不需要UI

vs. 智能音箱

  • ❌ 现有:控制家电和查询信息
  • ✅ MAIP:控制手机上的所有app

核心挑战

挑战1:生态建设 - 最大的难题

App厂商凭什么要接入?

这是最核心的挑战。现在每个app都有自己的UI、自己的用户路径、自己的数据。

  • 微信:为什么要开放接口让别人调用?
  • 美团:凭什么让用户不打开app就能点餐?
  • 电商:用户不看界面,怎么展示广告?

没有app支持,这个协议就是空中楼阁。

技术问题好解决,商业利益难协调。这是最大的挑战。


挑战2:鉴权与安全

如何确保用户真的是用户?

传统的密码、短信验证码,在语音交互场景下不适用:

  • 说话时无法输入密码
  • 开车时看不到验证码
  • 对话中要求输入密码很别扭

生物识别(声纹/人脸)面临的挑战:

  • 声纹可以录音伪造吗?
  • 人脸可以用照片骗过吗?
  • 如果验证错了,谁负责?

支付场景尤其敏感,一旦出错,用户损失真金白银。


挑战3:隐私保护

系统知道太多了,怎么办?

MAIP系统能看到:

  • 你在哪个app做了什么
  • 你的消费习惯、行为模式
  • 你的健康数据、通讯记录
  • 你的位置、行程

这些数据如果被滥用或泄露,后果很严重。

隐私保护没有完美解决方案,需要在便利性和隐私之间找到平衡。


技术可行性

所需的技术都已经存在:

  • ✅ 自然语言理解 - GPT已经很强
  • ✅ 声纹识别 - 银行已经在用
  • ✅ 人脸识别 - 支付宝已经在用
  • ✅ 车机语音交互 - 已经普及

缺的不是技术,缺的是统一的协议和生态共识。


愿景

让手机真正成为助手:

  • 不是一堆app的集合
  • 而是一个理解你、帮助你的智能伙伴

让科技真正为所有人服务:

  • 不让任何人因为身体或年龄被排除在外
  • 科技应该消除障碍,而不是制造障碍

这才是手机的终态。


技术文档

  • PROTOCOL.md - MAIP协议技术规范
    • 数据格式定义
    • 能力发现机制
    • 权限模型
    • 鉴权机制
    • 通信协议

About

MAIP协议:统一的移动应用互操作协议,让用户通过自然语言一句话完成跨app操作

Topics

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors