Trong khi đó, Samsung được cho là đang hướng tới việc sản xuất mô-đun CMM-D thế hệ tiếp theo của mình vào cuối năm nay, mặc dù các báo cáo riêng biệt hồi đầu tháng 7 cho biết thời gian này có thể bị lùi sang năm 2027 do các nền tảng máy chủ hỗ trợ, chủ yếu là bộ xử lý Intel và AMD, bị chậm tiến độ. Công ty cho biết rằng "mặc dù có một số thay đổi đối với một số phần trong kế hoạch", họ vẫn đang chuẩn bị bắt đầu sản xuất đúng tiến độ.
Động thái này phản ánh sự chuyển dịch trong lĩnh vực bộ nhớ AI, từ cuộc cạnh tranh về tốc độ thô sang cuộc cạnh tranh về cách thức hệ thống bộ nhớ được xây dựng. Vấn đề cốt lõi là dung lượng.
Trong các máy chủ AI hiện nay, HBM nằm cạnh bộ xử lý đồ họa và DRAM tiêu chuẩn nằm cạnh bộ xử lý trung tâm, nhưng cả hai đều không thể mở rộng độc lập vì mỗi loại đều gắn liền với chip mà nó phục vụ. Việc thêm bộ nhớ thường đồng nghĩa với việc thêm cả các bộ xử lý đắt tiền. CXL phá vỡ sự phụ thuộc đó, cho phép hệ thống đạt được dung lượng bộ nhớ lớn mà không cần mua thêm máy tính để chứa nó. Sức hấp dẫn của công nghệ này ngày càng tăng khi các nhà điều hành AI đang phải vật lộn với chi phí và nguồn cung GPU.
Áp lực ngày càng gia tăng khi AI chuyển từ việc huấn luyện mô hình sang vận hành chúng ở quy mô lớn. Việc phục vụ một mô hình ngôn ngữ lớn sẽ tạo ra một kho dữ liệu phiên ngày càng lớn, gọi là bộ nhớ đệm cặp khóa-giá trị, và một khi lượng dữ liệu này vượt quá bộ nhớ khả dụng, hệ thống sẽ chậm lại hoặc phải thực hiện lại công việc đã làm.
Cả hai nhà sản xuất đều đã chứng minh được hiệu quả của công nghệ này. Trong một thử nghiệm vào ngày 9 tháng 7, Samsung cho biết một vùng nhớ CXL 1 terabyte đạt khoảng 92% hiệu năng suy luận tương đương DRAM trên tám GPU, đồng thời có bộ nhớ đệm lớn hơn nhiều so với thiết lập thông thường. Các nhà nghiên cứu của SK hynix, trong một công trình được công bố vào tháng 6, đã báo cáo mức tăng thông lượng lên đến 35,7% khi sử dụng CXL làm tầng xử lý suy luận dùng chung ở quy mô terabyte. Cả hai con số này đều đến từ các thử nghiệm riêng của các công ty trong các điều kiện cụ thể.
CXL sẽ không thay thế HBM, vốn vẫn rất cần thiết để cung cấp dữ liệu cho các chip AI do nhu cầu tính toán đòi hỏi băng thông lớn. Nó mở rộng dung lượng song song với HBM, giải phóng bộ nhớ đắt tiền hơn cho những công việc cần tốc độ cao.
Tuy nhiên, lợi ích này không phải là tự động. Bộ nhớ CXL chậm hơn DRAM cục bộ, và phần lớn giá trị của nó phụ thuộc vào phần mềm quyết định dữ liệu nào nằm ở tầng nào. Điều đó đã khiến các bộ điều khiển, phần mềm nhúng và các công cụ quản lý bộ nhớ trở thành một phần của cuộc cạnh tranh cùng với các chip.
Hiện tại, công nghệ này vẫn còn ở giai đoạn đầu, thị trường đang chờ đợi các nền tảng máy chủ và phần mềm bắt kịp.
"Khi trí tuệ nhân tạo (AI) phát triển, nhu cầu thị trường đối với CXL cũng sẽ tăng lên, và điều đó thực sự bùng nổ từ năm 2026," Yim So-jung, một nhà phân tích tại Eugene Investment & Securities, cho biết. "Đến năm 2028, các nền tảng máy chủ có khả năng CXL sẽ trở thành xu hướng chủ đạo."