23#include <winpr/wtypes.h>
24#include <freerdp/config.h>
26#include <winpr/sysinfo.h>
28#include <freerdp/types.h>
29#include <freerdp/primitives.h>
31#include "prim_internal.h"
32#include "prim_avxsse.h"
35#if defined(SSE_AVX_INTRINSICS_ENABLED)
45static inline __m128i* sse41_YUV444Pixel(__m128i* WINPR_RESTRICT dst, __m128i Yraw, __m128i Uraw,
46 __m128i Vraw, UINT8 pos)
48 const __m128i mapY[] = { mm_set_epu32(0x80800380, 0x80800280, 0x80800180, 0x80800080),
49 mm_set_epu32(0x80800780, 0x80800680, 0x80800580, 0x80800480),
50 mm_set_epu32(0x80800B80, 0x80800A80, 0x80800980, 0x80800880),
51 mm_set_epu32(0x80800F80, 0x80800E80, 0x80800D80, 0x80800C80) };
52 const __m128i mapUV[] = { mm_set_epu32(0x80038002, 0x80018000, 0x80808080, 0x80808080),
53 mm_set_epu32(0x80078006, 0x80058004, 0x80808080, 0x80808080),
54 mm_set_epu32(0x800B800A, 0x80098008, 0x80808080, 0x80808080),
55 mm_set_epu32(0x800F800E, 0x800D800C, 0x80808080, 0x80808080) };
56 const __m128i mask[] = { mm_set_epu32(0x80038080, 0x80028080, 0x80018080, 0x80008080),
57 mm_set_epu32(0x80800380, 0x80800280, 0x80800180, 0x80800080),
58 mm_set_epu32(0x80808003, 0x80808002, 0x80808001, 0x80808000) };
59 const __m128i c128 = _mm_set1_epi16(128);
60 __m128i BGRX = _mm_and_si128(LOAD_SI128(dst),
61 mm_set_epu32(0xFF000000, 0xFF000000, 0xFF000000, 0xFF000000));
68 C = _mm_shuffle_epi8(Yraw, mapY[pos]);
72 const __m128i U = _mm_shuffle_epi8(Uraw, mapUV[pos]);
73 D = _mm_sub_epi16(U, c128);
77 const __m128i V = _mm_shuffle_epi8(Vraw, mapUV[pos]);
78 E = _mm_sub_epi16(V, c128);
82 const __m128i c403 = _mm_set1_epi16(403);
84 _mm_unpackhi_epi16(_mm_mullo_epi16(E, c403), _mm_mulhi_epi16(E, c403));
85 const __m128i Rs = _mm_add_epi32(C, e403);
86 const __m128i R32 = _mm_srai_epi32(Rs, 8);
87 const __m128i R16 = _mm_packs_epi32(R32, _mm_setzero_si128());
88 const __m128i R = _mm_packus_epi16(R16, _mm_setzero_si128());
89 const __m128i packed = _mm_shuffle_epi8(R, mask[0]);
90 BGRX = _mm_or_si128(BGRX, packed);
94 const __m128i c48 = _mm_set1_epi16(48);
96 _mm_unpackhi_epi16(_mm_mullo_epi16(D, c48), _mm_mulhi_epi16(D, c48));
97 const __m128i c120 = _mm_set1_epi16(120);
99 _mm_unpackhi_epi16(_mm_mullo_epi16(E, c120), _mm_mulhi_epi16(E, c120));
100 const __m128i de = _mm_add_epi32(d48, e120);
101 const __m128i Gs = _mm_sub_epi32(C, de);
102 const __m128i G32 = _mm_srai_epi32(Gs, 8);
103 const __m128i G16 = _mm_packs_epi32(G32, _mm_setzero_si128());
104 const __m128i G = _mm_packus_epi16(G16, _mm_setzero_si128());
105 const __m128i packed = _mm_shuffle_epi8(G, mask[1]);
106 BGRX = _mm_or_si128(BGRX, packed);
110 const __m128i c475 = _mm_set1_epi16(475);
112 _mm_unpackhi_epi16(_mm_mullo_epi16(D, c475), _mm_mulhi_epi16(D, c475));
113 const __m128i Bs = _mm_add_epi32(C, d475);
114 const __m128i B32 = _mm_srai_epi32(Bs, 8);
115 const __m128i B16 = _mm_packs_epi32(B32, _mm_setzero_si128());
116 const __m128i B = _mm_packus_epi16(B16, _mm_setzero_si128());
117 const __m128i packed = _mm_shuffle_epi8(B, mask[2]);
118 BGRX = _mm_or_si128(BGRX, packed);
121 STORE_SI128(dst++, BGRX);
125static inline pstatus_t sse41_YUV420ToRGB_BGRX(
const BYTE* WINPR_RESTRICT pSrc[],
126 const UINT32* WINPR_RESTRICT srcStep,
127 BYTE* WINPR_RESTRICT pDst, UINT32 dstStep,
130 const UINT32 nWidth = roi->width;
131 const UINT32 nHeight = roi->height;
132 const UINT32 pad = roi->width % 16;
133 const __m128i duplicate = _mm_set_epi8(7, 7, 6, 6, 5, 5, 4, 4, 3, 3, 2, 2, 1, 1, 0, 0);
135 for (
size_t y = 0; y < nHeight; y++)
137 __m128i* dst = WINPR_PACKED_ALIGN_CAST(__m128i*, (pDst + dstStep * y));
138 const BYTE* YData = pSrc[0] + y * srcStep[0];
139 const BYTE* UData = pSrc[1] + (y / 2) * srcStep[1];
140 const BYTE* VData = pSrc[2] + (y / 2) * srcStep[2];
142 for (UINT32 x = 0; x < nWidth - pad; x += 16)
144 const __m128i Y = LOAD_SI128(YData);
145 const __m128i uRaw = LOAD_SI128(UData);
146 const __m128i vRaw = LOAD_SI128(VData);
147 const __m128i U = _mm_shuffle_epi8(uRaw, duplicate);
148 const __m128i V = _mm_shuffle_epi8(vRaw, duplicate);
152 dst = sse41_YUV444Pixel(dst, Y, U, V, 0);
153 dst = sse41_YUV444Pixel(dst, Y, U, V, 1);
154 dst = sse41_YUV444Pixel(dst, Y, U, V, 2);
155 dst = sse41_YUV444Pixel(dst, Y, U, V, 3);
158 for (UINT32 x = 0; x < pad; x++)
160 const BYTE Y = *YData++;
161 const BYTE U = *UData;
162 const BYTE V = *VData;
163 dst = WINPR_PACKED_ALIGN_CAST(
164 __m128i*, writeYUVPixel((BYTE*)dst, PIXEL_FORMAT_BGRX32, Y, U, V, writePixelBGRX));
174 return PRIMITIVES_SUCCESS;
177static pstatus_t sse41_YUV420ToRGB(
const BYTE* WINPR_RESTRICT pSrc[3],
const UINT32 srcStep[3],
178 BYTE* WINPR_RESTRICT pDst, UINT32 dstStep, UINT32 DstFormat,
183 case PIXEL_FORMAT_BGRX32:
184 case PIXEL_FORMAT_BGRA32:
185 return sse41_YUV420ToRGB_BGRX(pSrc, srcStep, pDst, dstStep, roi);
188 return generic->YUV420ToRGB_8u_P3AC4R(pSrc, srcStep, pDst, dstStep, DstFormat, roi);
192static inline void BGRX_fillRGB(
size_t offset, BYTE* WINPR_RESTRICT pRGB[2],
193 const BYTE* WINPR_RESTRICT pY[2],
const BYTE* WINPR_RESTRICT pU[2],
194 const BYTE* WINPR_RESTRICT pV[2], BOOL filter)
201 const UINT32 DstFormat = PIXEL_FORMAT_BGRX32;
202 const UINT32 bpp = 4;
204 for (
size_t i = 0; i < 2; i++)
206 for (
size_t j = 0; j < 2; j++)
208 const BYTE Y = pY[i][offset + j];
209 BYTE U = pU[i][offset + j];
210 BYTE V = pV[i][offset + j];
211 if ((i == 0) && (j == 0) && filter)
214 4 * pU[0][offset] - pU[0][offset + 1] - pU[1][offset] - pU[1][offset + 1];
216 4 * pV[0][offset] - pV[0][offset + 1] - pV[1][offset] - pV[1][offset + 1];
218 U = CONDITIONAL_CLIP(avgU, pU[0][offset]);
219 V = CONDITIONAL_CLIP(avgV, pV[0][offset]);
222 writeYUVPixel(&pRGB[i][(j + offset) * bpp], DstFormat, Y, U, V, writePixelBGRX);
228static inline __m128i sse41_yuv2x_single(
const __m128i Y, __m128i U, __m128i V,
const short iMulU,
231 const __m128i zero = _mm_set1_epi8(0);
233 __m128i Ylo = _mm_unpacklo_epi16(Y, zero);
234 __m128i Yhi = _mm_unpackhi_epi16(Y, zero);
237 const __m128i addX = _mm_set1_epi16(128);
238 const __m128i D = _mm_sub_epi16(U, addX);
239 const __m128i mulU = _mm_set1_epi16(iMulU);
240 const __m128i mulDlo = _mm_mullo_epi16(D, mulU);
241 const __m128i mulDhi = _mm_mulhi_epi16(D, mulU);
242 const __m128i Dlo = _mm_unpacklo_epi16(mulDlo, mulDhi);
243 Ylo = _mm_add_epi32(Ylo, Dlo);
245 const __m128i Dhi = _mm_unpackhi_epi16(mulDlo, mulDhi);
246 Yhi = _mm_add_epi32(Yhi, Dhi);
250 const __m128i addX = _mm_set1_epi16(128);
251 const __m128i E = _mm_sub_epi16(V, addX);
252 const __m128i mul = _mm_set1_epi16(iMulV);
253 const __m128i mulElo = _mm_mullo_epi16(E, mul);
254 const __m128i mulEhi = _mm_mulhi_epi16(E, mul);
255 const __m128i Elo = _mm_unpacklo_epi16(mulElo, mulEhi);
256 const __m128i esumlo = _mm_add_epi32(Ylo, Elo);
258 const __m128i Ehi = _mm_unpackhi_epi16(mulElo, mulEhi);
259 const __m128i esumhi = _mm_add_epi32(Yhi, Ehi);
264 const __m128i rYlo = _mm_srai_epi32(Ylo, 8);
265 const __m128i rYhi = _mm_srai_epi32(Yhi, 8);
266 const __m128i rY = _mm_packs_epi32(rYlo, rYhi);
271static inline __m128i sse41_yuv2x(
const __m128i Y, __m128i U, __m128i V,
const short iMulU,
274 const __m128i zero = _mm_set1_epi8(0);
280 const __m128i Ylo = _mm_unpacklo_epi8(zero, Y);
281 const __m128i Ulo = _mm_unpacklo_epi8(U, zero);
282 const __m128i Vlo = _mm_unpacklo_epi8(V, zero);
283 const __m128i preslo = sse41_yuv2x_single(Ylo, Ulo, Vlo, iMulU, iMulV);
285 const __m128i Yhi = _mm_unpackhi_epi8(zero, Y);
286 const __m128i Uhi = _mm_unpackhi_epi8(U, zero);
287 const __m128i Vhi = _mm_unpackhi_epi8(V, zero);
288 const __m128i preshi = sse41_yuv2x_single(Yhi, Uhi, Vhi, iMulU, iMulV);
289 const __m128i res = _mm_packus_epi16(preslo, preshi);
295static inline __m128i sse41_yuv2r(
const __m128i Y, __m128i U, __m128i V)
297 return sse41_yuv2x(Y, U, V, 0, 403);
301static inline __m128i sse41_yuv2g(
const __m128i Y, __m128i U, __m128i V)
303 return sse41_yuv2x(Y, U, V, -48, -120);
307static inline __m128i sse41_yuv2b(
const __m128i Y, __m128i U, __m128i V)
309 return sse41_yuv2x(Y, U, V, 475, 0);
312static inline void sse41_BGRX_fillRGB_pixel(BYTE* WINPR_RESTRICT pRGB, __m128i Y, __m128i U,
315 const __m128i zero = _mm_set1_epi8(0);
317 const __m128i r = sse41_yuv2r(Y, U, V);
318 const __m128i rx[2] = { _mm_unpackhi_epi8(r, zero), _mm_unpacklo_epi8(r, zero) };
320 const __m128i g = sse41_yuv2g(Y, U, V);
321 const __m128i b = sse41_yuv2b(Y, U, V);
323 const __m128i bg[2] = { _mm_unpackhi_epi8(b, g), _mm_unpacklo_epi8(b, g) };
325 const __m128i mask = mm_set_epu8(0x00, 0xFF, 0xFF, 0xFF, 0x00, 0xFF, 0xFF, 0xFF, 0x00, 0xFF,
326 0xFF, 0xFF, 0x00, 0xFF, 0xFF, 0xFF);
328 __m128i* rgb = WINPR_PACKED_ALIGN_CAST(__m128i*, pRGB);
329 const __m128i bgrx0 = _mm_unpacklo_epi16(bg[1], rx[1]);
330 _mm_maskmoveu_si128(bgrx0, mask, (
char*)&rgb[0]);
331 const __m128i bgrx1 = _mm_unpackhi_epi16(bg[1], rx[1]);
332 _mm_maskmoveu_si128(bgrx1, mask, (
char*)&rgb[1]);
333 const __m128i bgrx2 = _mm_unpacklo_epi16(bg[0], rx[0]);
334 _mm_maskmoveu_si128(bgrx2, mask, (
char*)&rgb[2]);
335 const __m128i bgrx3 = _mm_unpackhi_epi16(bg[0], rx[0]);
336 _mm_maskmoveu_si128(bgrx3, mask, (
char*)&rgb[3]);
339static inline __m128i odd1sum(__m128i u1)
341 const __m128i zero = _mm_set1_epi8(0);
342 const __m128i u1hi = _mm_unpackhi_epi8(u1, zero);
343 const __m128i u1lo = _mm_unpacklo_epi8(u1, zero);
344 return _mm_hadds_epi16(u1lo, u1hi);
347static inline __m128i odd0sum(__m128i u0, __m128i u1sum)
351 const __m128i mask = mm_set_epu8(0x80, 0x0F, 0x80, 0x0D, 0x80, 0x0B, 0x80, 0x09, 0x80, 0x07,
352 0x80, 0x05, 0x80, 0x03, 0x80, 0x01);
353 const __m128i u0odd = _mm_shuffle_epi8(u0, mask);
354 return _mm_adds_epi16(u1sum, u0odd);
357static inline __m128i calcavg(__m128i u0even, __m128i sum)
359 const __m128i u4zero = _mm_slli_epi16(u0even, 2);
360 const __m128i uavg = _mm_sub_epi16(u4zero, sum);
361 const __m128i zero = _mm_set1_epi8(0);
362 const __m128i savg = _mm_packus_epi16(uavg, zero);
363 const __m128i smask = mm_set_epu8(0x80, 0x07, 0x80, 0x06, 0x80, 0x05, 0x80, 0x04, 0x80, 0x03,
364 0x80, 0x02, 0x80, 0x01, 0x80, 0x00);
365 return _mm_shuffle_epi8(savg, smask);
368static inline __m128i diffmask(__m128i avg, __m128i u0even)
373 const __m128i diff = _mm_subs_epi16(u0even, avg);
374 const __m128i absdiff = _mm_abs_epi16(diff);
375 const __m128i val30 = _mm_set1_epi16(30);
376 return _mm_cmplt_epi16(absdiff, val30);
379static inline void sse41_filter(__m128i pU[2])
381 const __m128i u1sum = odd1sum(pU[1]);
382 const __m128i sum = odd0sum(pU[0], u1sum);
385 const __m128i emask = mm_set_epu8(0x00, 0xff, 0x00, 0xff, 0x00, 0xff, 0x00, 0xff, 0x00, 0xff,
386 0x00, 0xff, 0x00, 0xff, 0x00, 0xff);
387 const __m128i u0even = _mm_and_si128(pU[0], emask);
388 const __m128i avg = calcavg(u0even, sum);
389 const __m128i umask = diffmask(avg, u0even);
391 const __m128i u0orig = _mm_and_si128(u0even, umask);
392 const __m128i u0avg = _mm_andnot_si128(umask, avg);
393 const __m128i evenresult = _mm_or_si128(u0orig, u0avg);
394 const __m128i omask = mm_set_epu8(0xFF, 0x00, 0xFF, 0x00, 0xFF, 0x00, 0xFF, 0x00, 0xFF, 0x00,
395 0xFF, 0x00, 0xFF, 0x00, 0xFF, 0x00);
396 const __m128i u0odd = _mm_and_si128(pU[0], omask);
397 const __m128i result = _mm_or_si128(evenresult, u0odd);
401static inline void sse41_BGRX_fillRGB(BYTE* WINPR_RESTRICT pRGB[2],
const __m128i pY[2],
402 __m128i pU[2], __m128i pV[2])
412 for (
size_t i = 0; i < 2; i++)
414 sse41_BGRX_fillRGB_pixel(pRGB[i], pY[i], pU[i], pV[i]);
418static inline pstatus_t sse41_YUV444ToRGB_8u_P3AC4R_BGRX_DOUBLE_ROW(
419 BYTE* WINPR_RESTRICT pDst[2],
const BYTE* WINPR_RESTRICT YData[2],
420 const BYTE* WINPR_RESTRICT UData[2],
const BYTE* WINPR_RESTRICT VData[2], UINT32 nWidth)
422 WINPR_ASSERT((nWidth % 2) == 0);
423 const UINT32 pad = nWidth % 16;
426 for (; x < nWidth - pad; x += 16)
428 const __m128i Y[] = { LOAD_SI128(&YData[0][x]), LOAD_SI128(&YData[1][x]) };
429 __m128i U[] = { LOAD_SI128(&UData[0][x]), LOAD_SI128(&UData[1][x]) };
430 __m128i V[] = { LOAD_SI128(&VData[0][x]), LOAD_SI128(&VData[1][x]) };
432 BYTE* dstp[] = { &pDst[0][x * 4], &pDst[1][x * 4] };
433 sse41_BGRX_fillRGB(dstp, Y, U, V);
436 for (; x < nWidth; x += 2)
438 BGRX_fillRGB(x, pDst, YData, UData, VData, TRUE);
441 return PRIMITIVES_SUCCESS;
444static inline void BGRX_fillRGB_single(
size_t offset, BYTE* WINPR_RESTRICT pRGB,
445 const BYTE* WINPR_RESTRICT pY,
const BYTE* WINPR_RESTRICT pU,
446 const BYTE* WINPR_RESTRICT pV, WINPR_ATTR_UNUSED BOOL filter)
453 const UINT32 bpp = 4;
455 for (
size_t j = 0; j < 2; j++)
457 const BYTE Y = pY[offset + j];
458 BYTE U = pU[offset + j];
459 BYTE V = pV[offset + j];
461 writeYUVPixel(&pRGB[(j + offset) * bpp], PIXEL_FORMAT_BGRX32, Y, U, V, writePixelBGRX);
465static inline pstatus_t sse41_YUV444ToRGB_8u_P3AC4R_BGRX_SINGLE_ROW(
466 BYTE* WINPR_RESTRICT pDst,
const BYTE* WINPR_RESTRICT YData,
const BYTE* WINPR_RESTRICT UData,
467 const BYTE* WINPR_RESTRICT VData, UINT32 nWidth)
469 WINPR_ASSERT((nWidth % 2) == 0);
471 for (
size_t x = 0; x < nWidth; x += 2)
473 BGRX_fillRGB_single(x, pDst, YData, UData, VData, TRUE);
476 return PRIMITIVES_SUCCESS;
479static inline pstatus_t sse41_YUV444ToRGB_8u_P3AC4R_BGRX(
const BYTE* WINPR_RESTRICT pSrc[],
480 const UINT32 srcStep[],
481 BYTE* WINPR_RESTRICT pDst, UINT32 dstStep,
484 const UINT32 nWidth = roi->width;
485 const UINT32 nHeight = roi->height;
488 for (; y < nHeight - nHeight % 2; y += 2)
490 BYTE* dst[] = { (pDst + dstStep * y), (pDst + dstStep * (y + 1)) };
491 const BYTE* YData[] = { pSrc[0] + y * srcStep[0], pSrc[0] + (y + 1) * srcStep[0] };
492 const BYTE* UData[] = { pSrc[1] + y * srcStep[1], pSrc[1] + (y + 1) * srcStep[1] };
493 const BYTE* VData[] = { pSrc[2] + y * srcStep[2], pSrc[2] + (y + 1) * srcStep[2] };
496 sse41_YUV444ToRGB_8u_P3AC4R_BGRX_DOUBLE_ROW(dst, YData, UData, VData, nWidth);
497 if (rc != PRIMITIVES_SUCCESS)
500 for (; y < nHeight; y++)
502 BYTE* dst = (pDst + dstStep * y);
503 const BYTE* YData = pSrc[0] + y * srcStep[0];
504 const BYTE* UData = pSrc[1] + y * srcStep[1];
505 const BYTE* VData = pSrc[2] + y * srcStep[2];
507 sse41_YUV444ToRGB_8u_P3AC4R_BGRX_SINGLE_ROW(dst, YData, UData, VData, nWidth);
508 if (rc != PRIMITIVES_SUCCESS)
512 return PRIMITIVES_SUCCESS;
515static pstatus_t sse41_YUV444ToRGB_8u_P3AC4R(
const BYTE* WINPR_RESTRICT pSrc[],
516 const UINT32 srcStep[], BYTE* WINPR_RESTRICT pDst,
517 UINT32 dstStep, UINT32 DstFormat,
522 case PIXEL_FORMAT_BGRX32:
523 case PIXEL_FORMAT_BGRA32:
524 return sse41_YUV444ToRGB_8u_P3AC4R_BGRX(pSrc, srcStep, pDst, dstStep, roi);
527 return generic->YUV444ToRGB_8u_P3AC4R(pSrc, srcStep, pDst, dstStep, DstFormat, roi);
556#define BGRX_Y_FACTORS _mm_set_epi8(0, 27, 92, 9, 0, 27, 92, 9, 0, 27, 92, 9, 0, 27, 92, 9)
557#define BGRX_U_FACTORS \
558 _mm_set_epi8(0, -29, -99, 127, 0, -29, -99, 127, 0, -29, -99, 127, 0, -29, -99, 127)
559#define BGRX_V_FACTORS \
560 _mm_set_epi8(0, 127, -116, -12, 0, 127, -116, -12, 0, 127, -116, -12, 0, 127, -116, -12)
561#define CONST128_FACTORS _mm_set1_epi8(-128)
584static inline void sse41_BGRX_TO_YUV(
const BYTE* WINPR_RESTRICT pLine1, BYTE* WINPR_RESTRICT pYLine,
585 BYTE* WINPR_RESTRICT pULine, BYTE* WINPR_RESTRICT pVLine)
587 const BYTE r1 = pLine1[2];
588 const BYTE g1 = pLine1[1];
589 const BYTE b1 = pLine1[0];
592 pYLine[0] = RGB2Y(r1, g1, b1);
594 pULine[0] = RGB2U(r1, g1, b1);
596 pVLine[0] = RGB2V(r1, g1, b1);
601static inline void sse41_RGBToYUV420_BGRX_Y(
const BYTE* WINPR_RESTRICT src, BYTE* dst, UINT32 width)
603 const __m128i y_factors = BGRX_Y_FACTORS;
604 const __m128i* argb = WINPR_PACKED_ALIGN_CAST(
const __m128i*, src);
605 __m128i* ydst = WINPR_PACKED_ALIGN_CAST(__m128i*, dst);
609 for (; x < width - width % 16; x += 16)
612 __m128i x0 = LOAD_SI128(argb++);
614 x0 = _mm_maddubs_epi16(x0, y_factors);
616 __m128i x1 = LOAD_SI128(argb++);
617 x1 = _mm_maddubs_epi16(x1, y_factors);
618 x0 = _mm_hadds_epi16(x0, x1);
619 x0 = _mm_srli_epi16(x0, Y_SHIFT);
622 __m128i x2 = LOAD_SI128(argb++);
624 x2 = _mm_maddubs_epi16(x2, y_factors);
626 __m128i x3 = LOAD_SI128(argb++);
627 x3 = _mm_maddubs_epi16(x3, y_factors);
628 x2 = _mm_hadds_epi16(x2, x3);
629 x2 = _mm_srli_epi16(x2, Y_SHIFT);
632 x0 = _mm_packus_epi16(x0, x2);
634 STORE_SI128(ydst++, x0);
637 for (; x < width; x++)
639 sse41_BGRX_TO_YUV(&src[4ULL * x], &dst[x],
nullptr,
nullptr);
645static inline void sse41_RGBToYUV420_BGRX_UV(
const BYTE* WINPR_RESTRICT src1,
646 const BYTE* WINPR_RESTRICT src2,
647 BYTE* WINPR_RESTRICT dst1, BYTE* WINPR_RESTRICT dst2,
650 const __m128i u_factors = BGRX_U_FACTORS;
651 const __m128i v_factors = BGRX_V_FACTORS;
652 const __m128i vector128 = CONST128_FACTORS;
656 for (; x < width - width % 16; x += 16)
658 const __m128i* rgb1 = WINPR_PACKED_ALIGN_CAST(
const __m128i*, &src1[4ULL * x]);
659 const __m128i* rgb2 = WINPR_PACKED_ALIGN_CAST(
const __m128i*, &src2[4ULL * x]);
660 __m64* udst = WINPR_PACKED_ALIGN_CAST(__m64*, &dst1[x / 2]);
661 __m64* vdst = WINPR_PACKED_ALIGN_CAST(__m64*, &dst2[x / 2]);
664 __m128i x0 = LOAD_SI128(&rgb1[0]);
665 __m128i x4 = LOAD_SI128(&rgb2[0]);
666 x0 = _mm_avg_epu8(x0, x4);
668 __m128i x1 = LOAD_SI128(&rgb1[1]);
669 x4 = LOAD_SI128(&rgb2[1]);
670 x1 = _mm_avg_epu8(x1, x4);
672 __m128i x2 = LOAD_SI128(&rgb1[2]);
673 x4 = LOAD_SI128(&rgb2[2]);
674 x2 = _mm_avg_epu8(x2, x4);
676 __m128i x3 = LOAD_SI128(&rgb1[3]);
677 x4 = LOAD_SI128(&rgb2[3]);
678 x3 = _mm_avg_epu8(x3, x4);
686 x4 = _mm_castps_si128(_mm_shuffle_ps(_mm_castsi128_ps(x0), _mm_castsi128_ps(x1), 0x88));
687 x0 = _mm_castps_si128(_mm_shuffle_ps(_mm_castsi128_ps(x0), _mm_castsi128_ps(x1), 0xdd));
688 x0 = _mm_avg_epu8(x0, x4);
689 x4 = _mm_castps_si128(_mm_shuffle_ps(_mm_castsi128_ps(x2), _mm_castsi128_ps(x3), 0x88));
690 x1 = _mm_castps_si128(_mm_shuffle_ps(_mm_castsi128_ps(x2), _mm_castsi128_ps(x3), 0xdd));
691 x1 = _mm_avg_epu8(x1, x4);
693 x2 = _mm_maddubs_epi16(x0, u_factors);
694 x3 = _mm_maddubs_epi16(x1, u_factors);
695 x4 = _mm_maddubs_epi16(x0, v_factors);
696 __m128i x5 = _mm_maddubs_epi16(x1, v_factors);
698 x0 = _mm_hadd_epi16(x2, x3);
699 x1 = _mm_hadd_epi16(x4, x5);
701 x0 = _mm_srai_epi16(x0, U_SHIFT);
702 x1 = _mm_srai_epi16(x1, V_SHIFT);
704 x0 = _mm_packs_epi16(x0, x1);
706 x0 = _mm_sub_epi8(x0, vector128);
708 _mm_storel_pi(udst, _mm_castsi128_ps(x0));
710 _mm_storeh_pi(vdst, _mm_castsi128_ps(x0));
713 for (; x < width - width % 2; x += 2)
715 BYTE u[4] = WINPR_C_ARRAY_INIT;
716 BYTE v[4] = WINPR_C_ARRAY_INIT;
717 sse41_BGRX_TO_YUV(&src1[4ULL * x],
nullptr, &u[0], &v[0]);
718 sse41_BGRX_TO_YUV(&src1[4ULL * (1ULL + x)],
nullptr, &u[1], &v[1]);
719 sse41_BGRX_TO_YUV(&src2[4ULL * x],
nullptr, &u[2], &v[2]);
720 sse41_BGRX_TO_YUV(&src2[4ULL * (1ULL + x)],
nullptr, &u[3], &v[3]);
721 const INT16 u4 = WINPR_ASSERTING_INT_CAST(INT16, (INT16)u[0] + u[1] + u[2] + u[3]);
722 const INT16 uu = WINPR_ASSERTING_INT_CAST(INT16, u4 / 4);
723 const BYTE u8 = CLIP(uu);
726 const INT16 v4 = WINPR_ASSERTING_INT_CAST(INT16, (INT16)v[0] + v[1] + v[2] + v[3]);
727 const INT16 vu = WINPR_ASSERTING_INT_CAST(INT16, v4 / 4);
728 const BYTE v8 = CLIP(vu);
733static pstatus_t sse41_RGBToYUV420_BGRX(
const BYTE* WINPR_RESTRICT pSrc, UINT32 srcStep,
734 BYTE* WINPR_RESTRICT pDst[],
const UINT32 dstStep[],
737 if (roi->height < 1 || roi->width < 1)
739 return !PRIMITIVES_SUCCESS;
743 for (; y < roi->height - roi->height % 2; y += 2)
745 const BYTE* line1 = &pSrc[y * srcStep];
746 const BYTE* line2 = &pSrc[(1ULL + y) * srcStep];
747 BYTE* ydst1 = &pDst[0][y * dstStep[0]];
748 BYTE* ydst2 = &pDst[0][(1ULL + y) * dstStep[0]];
749 BYTE* udst = &pDst[1][y / 2 * dstStep[1]];
750 BYTE* vdst = &pDst[2][y / 2 * dstStep[2]];
752 sse41_RGBToYUV420_BGRX_UV(line1, line2, udst, vdst, roi->width);
753 sse41_RGBToYUV420_BGRX_Y(line1, ydst1, roi->width);
754 sse41_RGBToYUV420_BGRX_Y(line2, ydst2, roi->width);
757 for (; y < roi->height; y++)
759 const BYTE* line = &pSrc[y * srcStep];
760 BYTE* ydst = &pDst[0][1ULL * y * dstStep[0]];
761 sse41_RGBToYUV420_BGRX_Y(line, ydst, roi->width);
764 return PRIMITIVES_SUCCESS;
767static pstatus_t sse41_RGBToYUV420(
const BYTE* WINPR_RESTRICT pSrc, UINT32 srcFormat,
768 UINT32 srcStep, BYTE* WINPR_RESTRICT pDst[],
769 const UINT32 dstStep[],
const prim_size_t* WINPR_RESTRICT roi)
773 case PIXEL_FORMAT_BGRX32:
774 case PIXEL_FORMAT_BGRA32:
775 return sse41_RGBToYUV420_BGRX(pSrc, srcStep, pDst, dstStep, roi);
778 return generic->RGBToYUV420_8u_P3AC4R(pSrc, srcFormat, srcStep, pDst, dstStep, roi);
786static inline void sse41_RGBToAVC444YUV_BGRX_DOUBLE_ROW(
787 const BYTE* WINPR_RESTRICT srcEven,
const BYTE* WINPR_RESTRICT srcOdd,
788 BYTE* WINPR_RESTRICT b1Even, BYTE* WINPR_RESTRICT b1Odd, BYTE* WINPR_RESTRICT b2,
789 BYTE* WINPR_RESTRICT b3, BYTE* WINPR_RESTRICT b4, BYTE* WINPR_RESTRICT b5,
790 BYTE* WINPR_RESTRICT b6, BYTE* WINPR_RESTRICT b7, UINT32 width)
792 const __m128i* argbEven = WINPR_PACKED_ALIGN_CAST(
const __m128i*, srcEven);
793 const __m128i* argbOdd = WINPR_PACKED_ALIGN_CAST(
const __m128i*, srcOdd);
794 const __m128i y_factors = BGRX_Y_FACTORS;
795 const __m128i u_factors = BGRX_U_FACTORS;
796 const __m128i v_factors = BGRX_V_FACTORS;
797 const __m128i vector128 = CONST128_FACTORS;
800 for (; x < width - width % 16; x += 16)
803 const __m128i xe1 = LOAD_SI128(argbEven++);
804 const __m128i xe2 = LOAD_SI128(argbEven++);
805 const __m128i xe3 = LOAD_SI128(argbEven++);
806 const __m128i xe4 = LOAD_SI128(argbEven++);
807 const __m128i xo1 = LOAD_SI128(argbOdd++);
808 const __m128i xo2 = LOAD_SI128(argbOdd++);
809 const __m128i xo3 = LOAD_SI128(argbOdd++);
810 const __m128i xo4 = LOAD_SI128(argbOdd++);
813 const __m128i ye1 = _mm_srli_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xe1, y_factors),
814 _mm_maddubs_epi16(xe2, y_factors)),
816 const __m128i ye2 = _mm_srli_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xe3, y_factors),
817 _mm_maddubs_epi16(xe4, y_factors)),
819 const __m128i ye = _mm_packus_epi16(ye1, ye2);
820 const __m128i yo1 = _mm_srli_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xo1, y_factors),
821 _mm_maddubs_epi16(xo2, y_factors)),
823 const __m128i yo2 = _mm_srli_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xo3, y_factors),
824 _mm_maddubs_epi16(xo4, y_factors)),
826 const __m128i yo = _mm_packus_epi16(yo1, yo2);
828 STORE_SI128(b1Even, ye);
833 STORE_SI128(b1Odd, yo);
845 __m128i uo = WINPR_C_ARRAY_INIT;
848 _mm_srai_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xe1, u_factors),
849 _mm_maddubs_epi16(xe2, u_factors)),
852 _mm_srai_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xe3, u_factors),
853 _mm_maddubs_epi16(xe4, u_factors)),
855 ue = _mm_sub_epi8(_mm_packs_epi16(ue1, ue2), vector128);
861 _mm_srai_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xo1, u_factors),
862 _mm_maddubs_epi16(xo2, u_factors)),
865 _mm_srai_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xo3, u_factors),
866 _mm_maddubs_epi16(xo4, u_factors)),
868 uo = _mm_sub_epi8(_mm_packs_epi16(uo1, uo2), vector128);
877 const __m128i ueh = _mm_unpackhi_epi8(ue, _mm_setzero_si128());
878 const __m128i uoh = _mm_unpackhi_epi8(uo, _mm_setzero_si128());
879 const __m128i hi = _mm_add_epi16(ueh, uoh);
880 const __m128i uel = _mm_unpacklo_epi8(ue, _mm_setzero_si128());
881 const __m128i uol = _mm_unpacklo_epi8(uo, _mm_setzero_si128());
882 const __m128i lo = _mm_add_epi16(uel, uol);
883 const __m128i added = _mm_hadd_epi16(lo, hi);
884 const __m128i avg16 = _mm_srai_epi16(added, 2);
885 const __m128i avg = _mm_packus_epi16(avg16, avg16);
886 _mm_storel_epi64(WINPR_PACKED_ALIGN_CAST(__m128i*, b2), avg);
891 _mm_set_epi8((
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80,
892 (
char)0x80, (
char)0x80, (
char)0x80, 14, 12, 10, 8, 6, 4, 2, 0);
893 const __m128i ud = _mm_shuffle_epi8(ue, mask);
894 _mm_storel_epi64(WINPR_PACKED_ALIGN_CAST(__m128i*, b2), ud);
908 _mm_set_epi8((
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80,
909 (
char)0x80, (
char)0x80, (
char)0x80, 15, 13, 11, 9, 7, 5, 3, 1);
910 const __m128i ude = _mm_shuffle_epi8(ue, mask);
911 _mm_storel_epi64(WINPR_PACKED_ALIGN_CAST(__m128i*, b6), ude);
923 __m128i vo = WINPR_C_ARRAY_INIT;
926 _mm_srai_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xe1, v_factors),
927 _mm_maddubs_epi16(xe2, v_factors)),
930 _mm_srai_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xe3, v_factors),
931 _mm_maddubs_epi16(xe4, v_factors)),
933 ve = _mm_sub_epi8(_mm_packs_epi16(ve1, ve2), vector128);
939 _mm_srai_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xo1, v_factors),
940 _mm_maddubs_epi16(xo2, v_factors)),
943 _mm_srai_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xo3, v_factors),
944 _mm_maddubs_epi16(xo4, v_factors)),
946 vo = _mm_sub_epi8(_mm_packs_epi16(vo1, vo2), vector128);
955 const __m128i veh = _mm_unpackhi_epi8(ve, _mm_setzero_si128());
956 const __m128i voh = _mm_unpackhi_epi8(vo, _mm_setzero_si128());
957 const __m128i hi = _mm_add_epi16(veh, voh);
958 const __m128i vel = _mm_unpacklo_epi8(ve, _mm_setzero_si128());
959 const __m128i vol = _mm_unpacklo_epi8(vo, _mm_setzero_si128());
960 const __m128i lo = _mm_add_epi16(vel, vol);
961 const __m128i added = _mm_hadd_epi16(lo, hi);
962 const __m128i avg16 = _mm_srai_epi16(added, 2);
963 const __m128i avg = _mm_packus_epi16(avg16, avg16);
964 _mm_storel_epi64(WINPR_PACKED_ALIGN_CAST(__m128i*, b3), avg);
969 _mm_set_epi8((
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80,
970 (
char)0x80, (
char)0x80, (
char)0x80, 14, 12, 10, 8, 6, 4, 2, 0);
971 const __m128i vd = _mm_shuffle_epi8(ve, mask);
972 _mm_storel_epi64(WINPR_PACKED_ALIGN_CAST(__m128i*, b3), vd);
986 _mm_set_epi8((
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80,
987 (
char)0x80, (
char)0x80, (
char)0x80, 15, 13, 11, 9, 7, 5, 3, 1);
988 const __m128i vde = _mm_shuffle_epi8(ve, mask);
989 _mm_storel_epi64(WINPR_PACKED_ALIGN_CAST(__m128i*, b7), vde);
995 general_RGBToAVC444YUV_BGRX_DOUBLE_ROW(x, srcEven, srcOdd, b1Even, b1Odd, b2, b3, b4, b5, b6,
999static pstatus_t sse41_RGBToAVC444YUV_BGRX(
const BYTE* WINPR_RESTRICT pSrc,
1000 WINPR_ATTR_UNUSED UINT32 srcFormat, UINT32 srcStep,
1001 BYTE* WINPR_RESTRICT pDst1[],
const UINT32 dst1Step[],
1002 BYTE* WINPR_RESTRICT pDst2[],
const UINT32 dst2Step[],
1005 if (roi->height < 1 || roi->width < 1)
1006 return !PRIMITIVES_SUCCESS;
1009 for (; y < roi->height - roi->height % 2; y += 2)
1011 const BYTE* srcEven = pSrc + y * srcStep;
1012 const BYTE* srcOdd = pSrc + (y + 1) * srcStep;
1013 const size_t i = y >> 1;
1014 const size_t n = (i & (size_t)~7) + i;
1015 BYTE* b1Even = pDst1[0] + y * dst1Step[0];
1016 BYTE* b1Odd = (b1Even + dst1Step[0]);
1017 BYTE* b2 = pDst1[1] + (y / 2) * dst1Step[1];
1018 BYTE* b3 = pDst1[2] + (y / 2) * dst1Step[2];
1019 BYTE* b4 = pDst2[0] + 1ULL * dst2Step[0] * n;
1020 BYTE* b5 = b4 + 8ULL * dst2Step[0];
1021 BYTE* b6 = pDst2[1] + (y / 2) * dst2Step[1];
1022 BYTE* b7 = pDst2[2] + (y / 2) * dst2Step[2];
1023 sse41_RGBToAVC444YUV_BGRX_DOUBLE_ROW(srcEven, srcOdd, b1Even, b1Odd, b2, b3, b4, b5, b6, b7,
1027 for (; y < roi->height; y++)
1029 const BYTE* srcEven = pSrc + y * srcStep;
1030 BYTE* b1Even = pDst1[0] + y * dst1Step[0];
1031 BYTE* b2 = pDst1[1] + (y / 2) * dst1Step[1];
1032 BYTE* b3 = pDst1[2] + (y / 2) * dst1Step[2];
1033 BYTE* b6 = pDst2[1] + (y / 2) * dst2Step[1];
1034 BYTE* b7 = pDst2[2] + (y / 2) * dst2Step[2];
1035 general_RGBToAVC444YUV_BGRX_DOUBLE_ROW(0, srcEven,
nullptr, b1Even,
nullptr, b2, b3,
1036 nullptr,
nullptr, b6, b7, roi->width);
1039 return PRIMITIVES_SUCCESS;
1042static pstatus_t sse41_RGBToAVC444YUV(
const BYTE* WINPR_RESTRICT pSrc, UINT32 srcFormat,
1043 UINT32 srcStep, BYTE* WINPR_RESTRICT pDst1[],
1044 const UINT32 dst1Step[], BYTE* WINPR_RESTRICT pDst2[],
1045 const UINT32 dst2Step[],
1050 case PIXEL_FORMAT_BGRX32:
1051 case PIXEL_FORMAT_BGRA32:
1052 return sse41_RGBToAVC444YUV_BGRX(pSrc, srcFormat, srcStep, pDst1, dst1Step, pDst2,
1056 return generic->RGBToAVC444YUV(pSrc, srcFormat, srcStep, pDst1, dst1Step, pDst2,
1074static inline void sse41_RGBToAVC444YUVv2_BGRX_DOUBLE_ROW(
1075 const BYTE* WINPR_RESTRICT srcEven,
const BYTE* WINPR_RESTRICT srcOdd,
1076 BYTE* WINPR_RESTRICT yLumaDstEven, BYTE* WINPR_RESTRICT yLumaDstOdd,
1077 BYTE* WINPR_RESTRICT uLumaDst, BYTE* WINPR_RESTRICT vLumaDst,
1078 BYTE* WINPR_RESTRICT yEvenChromaDst1, BYTE* WINPR_RESTRICT yEvenChromaDst2,
1079 BYTE* WINPR_RESTRICT yOddChromaDst1, BYTE* WINPR_RESTRICT yOddChromaDst2,
1080 BYTE* WINPR_RESTRICT uChromaDst1, BYTE* WINPR_RESTRICT uChromaDst2,
1081 BYTE* WINPR_RESTRICT vChromaDst1, BYTE* WINPR_RESTRICT vChromaDst2, UINT32 width)
1083 const __m128i vector128 = CONST128_FACTORS;
1084 const __m128i* argbEven = WINPR_PACKED_ALIGN_CAST(
const __m128i*, srcEven);
1085 const __m128i* argbOdd = WINPR_PACKED_ALIGN_CAST(
const __m128i*, srcOdd);
1088 for (; x < width - width % 16; x += 16)
1093 const __m128i xe1 = LOAD_SI128(argbEven++);
1094 const __m128i xe2 = LOAD_SI128(argbEven++);
1095 const __m128i xe3 = LOAD_SI128(argbEven++);
1096 const __m128i xe4 = LOAD_SI128(argbEven++);
1097 const __m128i xo1 = LOAD_SI128(argbOdd++);
1098 const __m128i xo2 = LOAD_SI128(argbOdd++);
1099 const __m128i xo3 = LOAD_SI128(argbOdd++);
1100 const __m128i xo4 = LOAD_SI128(argbOdd++);
1103 const __m128i y_factors = BGRX_Y_FACTORS;
1104 const __m128i ye1 = _mm_srli_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xe1, y_factors),
1105 _mm_maddubs_epi16(xe2, y_factors)),
1107 const __m128i ye2 = _mm_srli_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xe3, y_factors),
1108 _mm_maddubs_epi16(xe4, y_factors)),
1110 const __m128i ye = _mm_packus_epi16(ye1, ye2);
1112 STORE_SI128(yLumaDstEven, ye);
1118 const __m128i y_factors = BGRX_Y_FACTORS;
1119 const __m128i yo1 = _mm_srli_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xo1, y_factors),
1120 _mm_maddubs_epi16(xo2, y_factors)),
1122 const __m128i yo2 = _mm_srli_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xo3, y_factors),
1123 _mm_maddubs_epi16(xo4, y_factors)),
1125 const __m128i yo = _mm_packus_epi16(yo1, yo2);
1126 STORE_SI128(yLumaDstOdd, yo);
1142 const __m128i u_factors = BGRX_U_FACTORS;
1144 _mm_srai_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xe1, u_factors),
1145 _mm_maddubs_epi16(xe2, u_factors)),
1148 _mm_srai_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xe3, u_factors),
1149 _mm_maddubs_epi16(xe4, u_factors)),
1151 const __m128i ueavg = _mm_hadd_epi16(ue1, ue2);
1152 ue = _mm_sub_epi8(_mm_packs_epi16(ue1, ue2), vector128);
1156 const __m128i u_factors = BGRX_U_FACTORS;
1158 _mm_srai_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xo1, u_factors),
1159 _mm_maddubs_epi16(xo2, u_factors)),
1162 _mm_srai_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xo3, u_factors),
1163 _mm_maddubs_epi16(xo4, u_factors)),
1165 const __m128i uoavg = _mm_hadd_epi16(uo1, uo2);
1166 uo = _mm_sub_epi8(_mm_packs_epi16(uo1, uo2), vector128);
1167 uavg = _mm_add_epi16(uavg, uoavg);
1168 uavg = _mm_srai_epi16(uavg, 2);
1169 uavg = _mm_packs_epi16(uavg, uoavg);
1170 uavg = _mm_sub_epi8(uavg, vector128);
1178 const __m128i mask =
1179 _mm_set_epi8((
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80,
1180 (
char)0x80, (
char)0x80, (
char)0x80, 15, 13, 11, 9, 7, 5, 3, 1);
1181 const __m128i ude = _mm_shuffle_epi8(ue, mask);
1182 _mm_storel_epi64(WINPR_PACKED_ALIGN_CAST(__m128i*, yEvenChromaDst1), ude);
1183 yEvenChromaDst1 += 8;
1188 const __m128i mask =
1189 _mm_set_epi8((
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80,
1190 (
char)0x80, (
char)0x80, (
char)0x80, 15, 13, 11, 9, 7, 5, 3, 1);
1191 const __m128i udo = _mm_shuffle_epi8(uo, mask);
1192 _mm_storel_epi64(WINPR_PACKED_ALIGN_CAST(__m128i*, yOddChromaDst1),
1194 yOddChromaDst1 += 8;
1199 const __m128i mask =
1200 _mm_set_epi8((
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80,
1201 (
char)0x80, (
char)0x80, (
char)0x80, 14, 10, 6, 2, 12, 8, 4, 0);
1202 const __m128i ud = _mm_shuffle_epi8(uo, mask);
1203 int* uDst1 = WINPR_PACKED_ALIGN_CAST(
int*, uChromaDst1);
1204 int* vDst1 = WINPR_PACKED_ALIGN_CAST(
int*, vChromaDst1);
1205 const int* src = (
const int*)&ud;
1206 _mm_stream_si32(uDst1, src[0]);
1207 _mm_stream_si32(vDst1, src[1]);
1214 _mm_storel_epi64(WINPR_PACKED_ALIGN_CAST(__m128i*, uLumaDst), uavg);
1219 const __m128i mask =
1220 _mm_set_epi8((
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80,
1221 (
char)0x80, (
char)0x80, (
char)0x80, 14, 12, 10, 8, 6, 4, 2, 0);
1222 const __m128i ud = _mm_shuffle_epi8(ue, mask);
1223 _mm_storel_epi64(WINPR_PACKED_ALIGN_CAST(__m128i*, uLumaDst), ud);
1234 const __m128i v_factors = BGRX_V_FACTORS;
1236 _mm_srai_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xe1, v_factors),
1237 _mm_maddubs_epi16(xe2, v_factors)),
1240 _mm_srai_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xe3, v_factors),
1241 _mm_maddubs_epi16(xe4, v_factors)),
1243 const __m128i veavg = _mm_hadd_epi16(ve1, ve2);
1244 ve = _mm_sub_epi8(_mm_packs_epi16(ve1, ve2), vector128);
1248 const __m128i v_factors = BGRX_V_FACTORS;
1250 _mm_srai_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xo1, v_factors),
1251 _mm_maddubs_epi16(xo2, v_factors)),
1254 _mm_srai_epi16(_mm_hadd_epi16(_mm_maddubs_epi16(xo3, v_factors),
1255 _mm_maddubs_epi16(xo4, v_factors)),
1257 const __m128i voavg = _mm_hadd_epi16(vo1, vo2);
1258 vo = _mm_sub_epi8(_mm_packs_epi16(vo1, vo2), vector128);
1259 vavg = _mm_add_epi16(vavg, voavg);
1260 vavg = _mm_srai_epi16(vavg, 2);
1261 vavg = _mm_packs_epi16(vavg, voavg);
1262 vavg = _mm_sub_epi8(vavg, vector128);
1270 const __m128i mask =
1271 _mm_set_epi8((
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80,
1272 (
char)0x80, (
char)0x80, (
char)0x80, 15, 13, 11, 9, 7, 5, 3, 1);
1273 __m128i vde = _mm_shuffle_epi8(ve, mask);
1274 _mm_storel_epi64(WINPR_PACKED_ALIGN_CAST(__m128i*, yEvenChromaDst2), vde);
1275 yEvenChromaDst2 += 8;
1280 const __m128i mask =
1281 _mm_set_epi8((
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80,
1282 (
char)0x80, (
char)0x80, (
char)0x80, 15, 13, 11, 9, 7, 5, 3, 1);
1283 __m128i vdo = _mm_shuffle_epi8(vo, mask);
1284 _mm_storel_epi64(WINPR_PACKED_ALIGN_CAST(__m128i*, yOddChromaDst2), vdo);
1285 yOddChromaDst2 += 8;
1290 const __m128i mask =
1291 _mm_set_epi8((
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80,
1292 (
char)0x80, (
char)0x80, (
char)0x80, 14, 10, 6, 2, 12, 8, 4, 0);
1293 const __m128i vd = _mm_shuffle_epi8(vo, mask);
1294 int* uDst2 = WINPR_PACKED_ALIGN_CAST(
int*, uChromaDst2);
1295 int* vDst2 = WINPR_PACKED_ALIGN_CAST(
int*, vChromaDst2);
1296 const int* src = (
const int*)&vd;
1297 _mm_stream_si32(uDst2, src[0]);
1298 _mm_stream_si32(vDst2, src[1]);
1305 _mm_storel_epi64(WINPR_PACKED_ALIGN_CAST(__m128i*, vLumaDst), vavg);
1310 const __m128i mask =
1311 _mm_set_epi8((
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80, (
char)0x80,
1312 (
char)0x80, (
char)0x80, (
char)0x80, 14, 12, 10, 8, 6, 4, 2, 0);
1313 __m128i vd = _mm_shuffle_epi8(ve, mask);
1314 _mm_storel_epi64(WINPR_PACKED_ALIGN_CAST(__m128i*, vLumaDst), vd);
1320 general_RGBToAVC444YUVv2_BGRX_DOUBLE_ROW(x, srcEven, srcOdd, yLumaDstEven, yLumaDstOdd,
1321 uLumaDst, vLumaDst, yEvenChromaDst1, yEvenChromaDst2,
1322 yOddChromaDst1, yOddChromaDst2, uChromaDst1,
1323 uChromaDst2, vChromaDst1, vChromaDst2, width);
1326static pstatus_t sse41_RGBToAVC444YUVv2_BGRX(
const BYTE* WINPR_RESTRICT pSrc,
1327 WINPR_ATTR_UNUSED UINT32 srcFormat, UINT32 srcStep,
1328 BYTE* WINPR_RESTRICT pDst1[],
const UINT32 dst1Step[],
1329 BYTE* WINPR_RESTRICT pDst2[],
const UINT32 dst2Step[],
1332 if (roi->height < 1 || roi->width < 1)
1333 return !PRIMITIVES_SUCCESS;
1336 for (; y < roi->height - roi->height % 2; y += 2)
1338 const BYTE* srcEven = (pSrc + y * srcStep);
1339 const BYTE* srcOdd = (srcEven + srcStep);
1340 BYTE* dstLumaYEven = (pDst1[0] + y * dst1Step[0]);
1341 BYTE* dstLumaYOdd = (dstLumaYEven + dst1Step[0]);
1342 BYTE* dstLumaU = (pDst1[1] + (y / 2) * dst1Step[1]);
1343 BYTE* dstLumaV = (pDst1[2] + (y / 2) * dst1Step[2]);
1344 BYTE* dstEvenChromaY1 = (pDst2[0] + y * dst2Step[0]);
1345 BYTE* dstEvenChromaY2 = dstEvenChromaY1 + roi->width / 2;
1346 BYTE* dstOddChromaY1 = dstEvenChromaY1 + dst2Step[0];
1347 BYTE* dstOddChromaY2 = dstEvenChromaY2 + dst2Step[0];
1348 BYTE* dstChromaU1 = (pDst2[1] + (y / 2) * dst2Step[1]);
1349 BYTE* dstChromaV1 = (pDst2[2] + (y / 2) * dst2Step[2]);
1350 BYTE* dstChromaU2 = dstChromaU1 + roi->width / 4;
1351 BYTE* dstChromaV2 = dstChromaV1 + roi->width / 4;
1352 sse41_RGBToAVC444YUVv2_BGRX_DOUBLE_ROW(srcEven, srcOdd, dstLumaYEven, dstLumaYOdd, dstLumaU,
1353 dstLumaV, dstEvenChromaY1, dstEvenChromaY2,
1354 dstOddChromaY1, dstOddChromaY2, dstChromaU1,
1355 dstChromaU2, dstChromaV1, dstChromaV2, roi->width);
1358 for (; y < roi->height; y++)
1360 const BYTE* srcEven = (pSrc + y * srcStep);
1361 BYTE* dstLumaYEven = (pDst1[0] + y * dst1Step[0]);
1362 BYTE* dstLumaU = (pDst1[1] + (y / 2) * dst1Step[1]);
1363 BYTE* dstLumaV = (pDst1[2] + (y / 2) * dst1Step[2]);
1364 BYTE* dstEvenChromaY1 = (pDst2[0] + y * dst2Step[0]);
1365 BYTE* dstEvenChromaY2 = dstEvenChromaY1 + roi->width / 2;
1366 BYTE* dstChromaU1 = (pDst2[1] + (y / 2) * dst2Step[1]);
1367 BYTE* dstChromaV1 = (pDst2[2] + (y / 2) * dst2Step[2]);
1368 BYTE* dstChromaU2 = dstChromaU1 + roi->width / 4;
1369 BYTE* dstChromaV2 = dstChromaV1 + roi->width / 4;
1370 general_RGBToAVC444YUVv2_BGRX_DOUBLE_ROW(0, srcEven,
nullptr, dstLumaYEven,
nullptr,
1371 dstLumaU, dstLumaV, dstEvenChromaY1,
1372 dstEvenChromaY2,
nullptr,
nullptr, dstChromaU1,
1373 dstChromaU2, dstChromaV1, dstChromaV2, roi->width);
1376 return PRIMITIVES_SUCCESS;
1379static pstatus_t sse41_RGBToAVC444YUVv2(
const BYTE* WINPR_RESTRICT pSrc, UINT32 srcFormat,
1380 UINT32 srcStep, BYTE* WINPR_RESTRICT pDst1[],
1381 const UINT32 dst1Step[], BYTE* WINPR_RESTRICT pDst2[],
1382 const UINT32 dst2Step[],
1387 case PIXEL_FORMAT_BGRX32:
1388 case PIXEL_FORMAT_BGRA32:
1389 return sse41_RGBToAVC444YUVv2_BGRX(pSrc, srcFormat, srcStep, pDst1, dst1Step, pDst2,
1393 return generic->RGBToAVC444YUVv2(pSrc, srcFormat, srcStep, pDst1, dst1Step, pDst2,
1398static pstatus_t sse41_LumaToYUV444(
const BYTE* WINPR_RESTRICT pSrcRaw[],
const UINT32 srcStep[],
1399 BYTE* WINPR_RESTRICT pDstRaw[],
const UINT32 dstStep[],
1402 const UINT32 nWidth = roi->right - roi->left;
1403 const UINT32 nHeight = roi->bottom - roi->top;
1404 const UINT32 halfWidth = (nWidth + 1) / 2;
1405 const UINT32 halfPad = halfWidth % 16;
1406 const UINT32 halfHeight = (nHeight + 1) / 2;
1407 const UINT32 oddY = 1;
1408 const UINT32 evenY = 0;
1409 const UINT32 oddX = 1;
1410 const UINT32 evenX = 0;
1411 const BYTE* pSrc[3] = { pSrcRaw[0] + 1ULL * roi->top * srcStep[0] + roi->left,
1412 pSrcRaw[1] + 1ULL * roi->top / 2 * srcStep[1] + roi->left / 2,
1413 pSrcRaw[2] + 1ULL * roi->top / 2 * srcStep[2] + roi->left / 2 };
1414 BYTE* pDst[3] = { pDstRaw[0] + 1ULL * roi->top * dstStep[0] + roi->left,
1415 pDstRaw[1] + 1ULL * roi->top * dstStep[1] + roi->left,
1416 pDstRaw[2] + 1ULL * roi->top * dstStep[2] + roi->left };
1420 for (
size_t y = 0; y < nHeight; y++)
1422 const BYTE* Ym = pSrc[0] + y * srcStep[0];
1423 BYTE* pY = pDst[0] + y * dstStep[0];
1424 memcpy(pY, Ym, nWidth);
1429 for (
size_t y = 0; y < halfHeight; y++)
1431 const size_t val2y = (2 * y + evenY);
1432 const size_t val2y1 = val2y + oddY;
1433 const BYTE* Um = pSrc[1] + 1ULL * srcStep[1] * y;
1434 const BYTE* Vm = pSrc[2] + 1ULL * srcStep[2] * y;
1435 BYTE* pU = pDst[1] + 1ULL * dstStep[1] * val2y;
1436 BYTE* pV = pDst[2] + 1ULL * dstStep[2] * val2y;
1437 BYTE* pU1 = pDst[1] + 1ULL * dstStep[1] * val2y1;
1438 BYTE* pV1 = pDst[2] + 1ULL * dstStep[2] * val2y1;
1441 for (; x < halfWidth - halfPad; x += 16)
1443 const __m128i unpackHigh = _mm_set_epi8(7, 7, 6, 6, 5, 5, 4, 4, 3, 3, 2, 2, 1, 1, 0, 0);
1444 const __m128i unpackLow =
1445 _mm_set_epi8(15, 15, 14, 14, 13, 13, 12, 12, 11, 11, 10, 10, 9, 9, 8, 8);
1447 const __m128i u = LOAD_SI128(&Um[x]);
1448 const __m128i uHigh = _mm_shuffle_epi8(u, unpackHigh);
1449 const __m128i uLow = _mm_shuffle_epi8(u, unpackLow);
1450 STORE_SI128(&pU[2ULL * x], uHigh);
1451 STORE_SI128(&pU[2ULL * x + 16], uLow);
1452 STORE_SI128(&pU1[2ULL * x], uHigh);
1453 STORE_SI128(&pU1[2ULL * x + 16], uLow);
1456 const __m128i u = LOAD_SI128(&Vm[x]);
1457 const __m128i uHigh = _mm_shuffle_epi8(u, unpackHigh);
1458 const __m128i uLow = _mm_shuffle_epi8(u, unpackLow);
1459 STORE_SI128(&pV[2 * x], uHigh);
1460 STORE_SI128(&pV[2 * x + 16], uLow);
1461 STORE_SI128(&pV1[2 * x], uHigh);
1462 STORE_SI128(&pV1[2 * x + 16], uLow);
1466 for (; x < halfWidth; x++)
1468 const size_t val2x = 2 * x + evenX;
1469 const size_t val2x1 = val2x + oddX;
1476 pU1[val2x1] = Um[x];
1477 pV1[val2x1] = Vm[x];
1481 return PRIMITIVES_SUCCESS;
1484static pstatus_t sse41_ChromaV1ToYUV444(
const BYTE* WINPR_RESTRICT pSrcRaw[3],
1485 const UINT32 srcStep[3], BYTE* WINPR_RESTRICT pDstRaw[3],
1486 const UINT32 dstStep[3],
1489 const UINT32 mod = 16;
1492 const UINT32 nWidth = roi->right - roi->left;
1493 const UINT32 nHeight = roi->bottom - roi->top;
1494 const UINT32 halfWidth = (nWidth + 1) / 2;
1495 const UINT32 halfPad = halfWidth % 16;
1496 const UINT32 halfHeight = (nHeight + 1) / 2;
1497 const UINT32 oddY = 1;
1498 const UINT32 evenY = 0;
1499 const UINT32 oddX = 1;
1502 const UINT32 padHeight = nHeight + 16 - nHeight % 16;
1503 const BYTE* pSrc[3] = { pSrcRaw[0] + 1ULL * roi->top * srcStep[0] + roi->left,
1504 pSrcRaw[1] + 1ULL * roi->top / 2 * srcStep[1] + roi->left / 2,
1505 pSrcRaw[2] + 1ULL * roi->top / 2 * srcStep[2] + roi->left / 2 };
1506 BYTE* pDst[3] = { pDstRaw[0] + 1ULL * roi->top * dstStep[0] + roi->left,
1507 pDstRaw[1] + 1ULL * roi->top * dstStep[1] + roi->left,
1508 pDstRaw[2] + 1ULL * roi->top * dstStep[2] + roi->left };
1509 const __m128i zero = _mm_setzero_si128();
1510 const __m128i mask = _mm_set_epi8(0, (
char)0x80, 0, (
char)0x80, 0, (
char)0x80, 0, (
char)0x80, 0,
1511 (
char)0x80, 0, (
char)0x80, 0, (
char)0x80, 0, (
char)0x80);
1515 for (
size_t y = 0; y < padHeight; y++)
1517 const BYTE* Ya = pSrc[0] + 1ULL * srcStep[0] * y;
1520 if ((y) % mod < (mod + 1) / 2)
1522 const UINT32 pos = (2 * uY++ + oddY);
1527 pX = pDst[1] + 1ULL * dstStep[1] * pos;
1531 const UINT32 pos = (2 * vY++ + oddY);
1536 pX = pDst[2] + 1ULL * dstStep[2] * pos;
1540 memcpy(pX, Ya, nWidth);
1544 for (
size_t y = 0; y < halfHeight; y++)
1546 const size_t val2y = (y * 2 + evenY);
1547 const BYTE* Ua = pSrc[1] + srcStep[1] * y;
1548 const BYTE* Va = pSrc[2] + srcStep[2] * y;
1549 BYTE* pU = pDst[1] + dstStep[1] * val2y;
1550 BYTE* pV = pDst[2] + dstStep[2] * val2y;
1553 for (; x < halfWidth - halfPad; x += 16)
1556 const __m128i u = LOAD_SI128(&Ua[x]);
1557 const __m128i u2 = _mm_unpackhi_epi8(u, zero);
1558 const __m128i u1 = _mm_unpacklo_epi8(u, zero);
1559 _mm_maskmoveu_si128(u1, mask, (
char*)&pU[2 * x]);
1560 _mm_maskmoveu_si128(u2, mask, (
char*)&pU[2 * x + 16]);
1563 const __m128i u = LOAD_SI128(&Va[x]);
1564 const __m128i u2 = _mm_unpackhi_epi8(u, zero);
1565 const __m128i u1 = _mm_unpacklo_epi8(u, zero);
1566 _mm_maskmoveu_si128(u1, mask, (
char*)&pV[2 * x]);
1567 _mm_maskmoveu_si128(u2, mask, (
char*)&pV[2 * x + 16]);
1571 for (; x < halfWidth; x++)
1573 const size_t val2x1 = (x * 2ULL + oddX);
1579 return PRIMITIVES_SUCCESS;
1582static pstatus_t sse41_ChromaV2ToYUV444(
const BYTE* WINPR_RESTRICT pSrc[3],
const UINT32 srcStep[3],
1583 UINT32 nTotalWidth, WINPR_ATTR_UNUSED UINT32 nTotalHeight,
1584 BYTE* WINPR_RESTRICT pDst[3],
const UINT32 dstStep[3],
1587 const UINT32 nWidth = roi->right - roi->left;
1588 const UINT32 nHeight = roi->bottom - roi->top;
1589 const UINT32 halfWidth = (nWidth + 1) / 2;
1590 const UINT32 halfPad = halfWidth % 16;
1591 const UINT32 halfHeight = (nHeight + 1) / 2;
1592 const UINT32 quaterWidth = (nWidth + 3) / 4;
1593 const UINT32 quaterPad = quaterWidth % 16;
1594 const __m128i zero = _mm_setzero_si128();
1595 const __m128i mask = _mm_set_epi8((
char)0x80, 0, (
char)0x80, 0, (
char)0x80, 0, (
char)0x80, 0,
1596 (
char)0x80, 0, (
char)0x80, 0, (
char)0x80, 0, (
char)0x80, 0);
1597 const __m128i mask2 = _mm_set_epi8(0, (
char)0x80, 0, (
char)0x80, 0, (
char)0x80, 0, (
char)0x80,
1598 0, (
char)0x80, 0, (
char)0x80, 0, (
char)0x80, 0, (
char)0x80);
1599 const __m128i shuffle1 =
1600 _mm_set_epi8((
char)0x80, 15, (
char)0x80, 14, (
char)0x80, 13, (
char)0x80, 12, (
char)0x80, 11,
1601 (
char)0x80, 10, (
char)0x80, 9, (
char)0x80, 8);
1602 const __m128i shuffle2 =
1603 _mm_set_epi8((
char)0x80, 7, (
char)0x80, 6, (
char)0x80, 5, (
char)0x80, 4, (
char)0x80, 3,
1604 (
char)0x80, 2, (
char)0x80, 1, (
char)0x80, 0);
1607 for (
size_t y = 0; y < nHeight; y++)
1609 const size_t yTop = y + roi->top;
1610 const BYTE* pYaU = pSrc[0] + srcStep[0] * yTop + roi->left / 2;
1611 const BYTE* pYaV = pYaU + nTotalWidth / 2;
1612 BYTE* pU = pDst[1] + 1ULL * dstStep[1] * yTop + roi->left;
1613 BYTE* pV = pDst[2] + 1ULL * dstStep[2] * yTop + roi->left;
1616 for (; x < halfWidth - halfPad; x += 16)
1619 const __m128i u = LOAD_SI128(&pYaU[x]);
1620 const __m128i u2 = _mm_unpackhi_epi8(zero, u);
1621 const __m128i u1 = _mm_unpacklo_epi8(zero, u);
1622 _mm_maskmoveu_si128(u1, mask, (
char*)&pU[2 * x]);
1623 _mm_maskmoveu_si128(u2, mask, (
char*)&pU[2 * x + 16]);
1626 const __m128i v = LOAD_SI128(&pYaV[x]);
1627 const __m128i v2 = _mm_unpackhi_epi8(zero, v);
1628 const __m128i v1 = _mm_unpacklo_epi8(zero, v);
1629 _mm_maskmoveu_si128(v1, mask, (
char*)&pV[2 * x]);
1630 _mm_maskmoveu_si128(v2, mask, (
char*)&pV[2 * x + 16]);
1634 for (; x < halfWidth; x++)
1636 const size_t odd = 2ULL * x + 1;
1643 for (
size_t y = 0; y < halfHeight; y++)
1645 const BYTE* pUaU = pSrc[1] + srcStep[1] * (y + roi->top / 2) + roi->left / 4;
1646 const BYTE* pUaV = pUaU + nTotalWidth / 4;
1647 const BYTE* pVaU = pSrc[2] + srcStep[2] * (y + roi->top / 2) + roi->left / 4;
1648 const BYTE* pVaV = pVaU + nTotalWidth / 4;
1649 BYTE* pU = pDst[1] + dstStep[1] * (2 * y + 1 + roi->top) + roi->left;
1650 BYTE* pV = pDst[2] + dstStep[2] * (2 * y + 1 + roi->top) + roi->left;
1653 for (; x < quaterWidth - quaterPad; x += 16)
1656 const __m128i uU = LOAD_SI128(&pUaU[x]);
1657 const __m128i uV = LOAD_SI128(&pVaU[x]);
1658 const __m128i uHigh = _mm_unpackhi_epi8(uU, uV);
1659 const __m128i uLow = _mm_unpacklo_epi8(uU, uV);
1660 const __m128i u1 = _mm_shuffle_epi8(uLow, shuffle2);
1661 const __m128i u2 = _mm_shuffle_epi8(uLow, shuffle1);
1662 const __m128i u3 = _mm_shuffle_epi8(uHigh, shuffle2);
1663 const __m128i u4 = _mm_shuffle_epi8(uHigh, shuffle1);
1664 _mm_maskmoveu_si128(u1, mask2, (
char*)&pU[4 * x + 0]);
1665 _mm_maskmoveu_si128(u2, mask2, (
char*)&pU[4 * x + 16]);
1666 _mm_maskmoveu_si128(u3, mask2, (
char*)&pU[4 * x + 32]);
1667 _mm_maskmoveu_si128(u4, mask2, (
char*)&pU[4 * x + 48]);
1670 const __m128i vU = LOAD_SI128(&pUaV[x]);
1671 const __m128i vV = LOAD_SI128(&pVaV[x]);
1672 const __m128i vHigh = _mm_unpackhi_epi8(vU, vV);
1673 const __m128i vLow = _mm_unpacklo_epi8(vU, vV);
1674 const __m128i v1 = _mm_shuffle_epi8(vLow, shuffle2);
1675 const __m128i v2 = _mm_shuffle_epi8(vLow, shuffle1);
1676 const __m128i v3 = _mm_shuffle_epi8(vHigh, shuffle2);
1677 const __m128i v4 = _mm_shuffle_epi8(vHigh, shuffle1);
1678 _mm_maskmoveu_si128(v1, mask2, (
char*)&pV[4 * x + 0]);
1679 _mm_maskmoveu_si128(v2, mask2, (
char*)&pV[4 * x + 16]);
1680 _mm_maskmoveu_si128(v3, mask2, (
char*)&pV[4 * x + 32]);
1681 _mm_maskmoveu_si128(v4, mask2, (
char*)&pV[4 * x + 48]);
1685 for (; x < quaterWidth; x++)
1687 pU[4 * x + 0] = pUaU[x];
1688 pV[4 * x + 0] = pUaV[x];
1689 pU[4 * x + 2] = pVaU[x];
1690 pV[4 * x + 2] = pVaV[x];
1694 return PRIMITIVES_SUCCESS;
1697static pstatus_t sse41_YUV420CombineToYUV444(avc444_frame_type type,
1698 const BYTE* WINPR_RESTRICT pSrc[3],
1699 const UINT32 srcStep[3], UINT32 nWidth, UINT32 nHeight,
1700 BYTE* WINPR_RESTRICT pDst[3],
const UINT32 dstStep[3],
1703 if (!pSrc || !pSrc[0] || !pSrc[1] || !pSrc[2])
1706 if (!pDst || !pDst[0] || !pDst[1] || !pDst[2])
1715 return sse41_LumaToYUV444(pSrc, srcStep, pDst, dstStep, roi);
1717 case AVC444_CHROMAv1:
1718 return sse41_ChromaV1ToYUV444(pSrc, srcStep, pDst, dstStep, roi);
1720 case AVC444_CHROMAv2:
1721 return sse41_ChromaV2ToYUV444(pSrc, srcStep, nWidth, nHeight, pDst, dstStep, roi);
1729void primitives_init_YUV_sse41_int(
primitives_t* WINPR_RESTRICT prims)
1731#if defined(SSE_AVX_INTRINSICS_ENABLED)
1732 generic = primitives_get_generic();
1734 WLog_VRB(PRIM_TAG,
"SSE3/sse41 optimizations");
1735 prims->RGBToYUV420_8u_P3AC4R = sse41_RGBToYUV420;
1736 prims->RGBToAVC444YUV = sse41_RGBToAVC444YUV;
1737 prims->RGBToAVC444YUVv2 = sse41_RGBToAVC444YUVv2;
1738 prims->YUV420ToRGB_8u_P3AC4R = sse41_YUV420ToRGB;
1739 prims->YUV444ToRGB_8u_P3AC4R = sse41_YUV444ToRGB_8u_P3AC4R;
1740 prims->YUV420CombineToYUV444 = sse41_YUV420CombineToYUV444;
1742 WLog_VRB(PRIM_TAG,
"undefined WITH_SIMD or sse41 intrinsics not available");
1743 WINPR_UNUSED(prims);