ggaaooppeenngg

为什么计算机科学是无限的但生命是有限的

vLLM的PD分离

vLLM的PD分离是指vLLM的Prefill和Decode分离到不同的实例中执行。

阅读全文 »

LoRA一般的设定是认为微调任务应该只需要在一个更小的子空间去训练即可不需要复用基座模型的大空间,从而实现低成本的微调。
LoRA的前提是问题是不是在子空间能得到最优解。在线性回归 y=W x 中,如果最优 W * 是高秩的,那么对 W 施加低秩假设永远不会导致最优解,无论使用什么优化器。

阅读全文 »