Trendora

x-prediction

Hold

Kỹ thuật

Một cách biểu diễn cho mô hình khuếch tán, dự đoán trực tiếp ảnh sạch trong không gian pixel.

Vì sao ở đây

Xếp vào Hold: 1 bài bằng chứng từ 1 nguồn, chủ yếu là tin nghiên cứu, 0 bài trong 30 ngày qua. Độ tin cậy 24%. Bằng chứng còn ít nên xếp thận trọng, chờ thêm tín hiệu.

Bằng chứng (1)

  • 7Hugging Face Blog·3/3/2026research
    Photoroom công bố công thức huấn luyện mô hình văn bản sang ảnh trong 24 giờ

    Photoroom trình bày cách kết hợp nhiều tối ưu hóa huấn luyện cho mô hình khuếch tán trong một bài thử nghiệm kéo dài 24 giờ trên 32 GPU H200 với ngân sách tính toán khoảng 1.500 USD. Công thức này dùng x-prediction trong không gian pixel, bắt đầu ở 512px rồi tinh chỉnh lên 1024px, đồng thời bổ sung các hàm mất mát cảm nhận như LPIPS và giám sát dựa trên DINOv2. Nhóm cũng công bố mã nguồn mở và khung thực nghiệm dùng trong quá trình chạy thử.