SpecQuant: Speculative Decoding with Multi-Parent Quantization for Adaptive LLM Inference
为解决本地运行大语言模型的计算和内存限制,SpecQuant结合推测解码与多父量化,自适应选择不同精度模型以提高推理效率。
0 citationsRead paper
为解决本地运行大语言模型的计算和内存限制,SpecQuant结合推测解码与多父量化,自适应选择不同精度模型以提高推理效率。
本文提出EmpathicVA框架,通过整合生理感知、情感分析、情境建模和强化学习来优化语音助手的打断策略,以提高用户满意度和减少压力。
为解决胸部X光片中异常检测的低对比度等问题,提出了一种基于指数像素积分变换和双重分形特征的方法,提高了疾病诊断的准确性。
本文提出一种轻量级且后量子安全框架,用于IEC 61869-9采样值通信,通过优化的Chaskey-12实现消息完整性验证,并使用基于ML-KEM的密钥建立协议确保信任。
研究解决了分割联邦微调中深度与性能之间的矛盾,通过分析不同模型规模和基准测试,发现增加深度虽提高吞吐量和隐私但损害性能,并指出当前聚合方法无法解决此问题。
为解决本地运行大语言模型的计算和内存限制,SpecQuant结合推测解码与多父量化,自适应选择不同精度模型以提高推理效率。
本文提出EmpathicVA框架,通过整合生理感知、情感分析、情境建模和强化学习来优化语音助手的打断策略,以提高用户满意度和减少压力。
为解决胸部X光片中异常检测的低对比度等问题,提出了一种基于指数像素积分变换和双重分形特征的方法,提高了疾病诊断的准确性。
本文提出一种轻量级且后量子安全框架,用于IEC 61869-9采样值通信,通过优化的Chaskey-12实现消息完整性验证,并使用基于ML-KEM的密钥建立协议确保信任。
研究解决了分割联邦微调中深度与性能之间的矛盾,通过分析不同模型规模和基准测试,发现增加深度虽提高吞吐量和隐私但损害性能,并指出当前聚合方法无法解决此问题。