01
效率
如何让终端在利用大模型能力时,节省 Token 消耗,提高 Token 效率?
加载中…
EDGE INTELLIGENCE · CLOUD–EDGE COLLABORATION
Edge Intelligence
构建软硬一体化边缘协同推理框架,打破大模型落地“延迟-效率-隐私”三角难题。

大模型走向终端与产业现场时,必须同时回答效率、延迟、算力与安全问题。
01
如何让终端在利用大模型能力时,节省 Token 消耗,提高 Token 效率?
02
如何有效降低首 Token 延迟(TTFT)?
03
如何提高推理加速比?
04
如何更好地保护本地隐私数据?
终端异构双脑与云端大模型协同:端侧 Draft 预测,云侧并行验证,形成高效、安全、低延迟的推理闭环。
端侧采用轻量模型(如 Qwen-0.8B)运行 Draft 预测
云侧大模型对 Token 序列进行并行验证
01
本地数据处理
脱敏 / 压缩 / 特征提取(由 AI 推理芯片本地执行)
02
Draft 预测
本地生成 Token 序列
03
云端并行验证
Token 序列交由云端验证
04
返回结果
高效、安全、低延迟
从算法到芯片,构建可落地的边缘协同推理能力。
01
核心技术
01
将串行推理转化为局部并行计算,实现本地 Draft、云端验证,提升端云协同吞吐。
02
核心技术
02
将原始数据转化为高信息密度脱敏特征向量(Embedding),降低无效 Token 开销。
03
核心技术
03
构建硬件级物理隔离加密计算环境,“数据不出端、特征才上云”。
04
核心技术
04
针对 Transformer 算子优化的底层硬件,包含高效 KV Cache 管理与低功耗矩阵运算。
以目标指标刻画边缘协同架构带来的效率、体验与信任收益。
2~3x
目标推理加速比
TTFT ↓
首 Token 延迟显著降低
50%+
预计节省云端 Token 消耗
最高级别
隐私本地化(数据不出端,仅传输特征)