1. LOCKSが長文コンテキストのKVキャッシュ読み出しを削減

    [PROGRAMMING]

    長文推論でのKVキャッシュ帯域不足に対し、各ページを個別に低次元分解して必要な領域だけ読む手法「LOCKS」が提案された。1Mトークン規模で読み出し量を大きく減らせるとしている。