libbgi: NOT_PUT тоже через акселератор + изыскания по виду Тени

NOT.  У акселератора нет режима «инвертировать буфер»: буфер меняется
только на ЧТЕНИИ и только опкодами AND/OR/XOR (HL) (драйвер MAME,
update_accel_buffer), а `CPL` автомат вообще не распознаёт — инвертируется
регистр CPU, не буфер.  Зато ~src = src XOR #FF, поэтому NOT собирается из
уже имеющегося: буфер := src, XOR-burst по константному блоку единиц
(common/_bgi_ones256.c), запись.  Ядра _bgi_blit_{rows,cols}_not_raw.c;
между burst'ами меняется HL, поэтому каждая смена — под СТОПом (иначе fetch
операнда перезапустит burst).  В колоночном варианте второй OUT Port_Y не
нужен: op-burst идёт по блоку единиц горизонтально, а Port_Y шагает только
вертикальный.

Наружу — тем же op-параметром (GFX_OP_NOT), диспетчер один раз на вызов, в
цикл по полосам/колонкам не заходит.  putimage лишился попиксельного пути
ЦЕЛИКОМ: все пять операций BGI идут через акселератор и клиппируются
одинаково.  tests/accop дополнен T9/T10 (NOT строками и колонками) —
10/10 PASS в MAME; tests/bgi_img P1/P2 по-прежнему PASS.

tests/convbench (новый) — замер побайтной конвертации атласа
«прозрачный #FF -> 0x00» (источник для XOR-блита): 145.3 такта/байт, то
есть 2.5× от 59 номинальных T-states цикла.  0.11 с на страницу 16 КБ,
3.2 с на все 28 страниц, 1.3 с по фактическому объёму данных (186 КБ).

applications/PoP/docs/shadow_render.md — вид Тени (два блиттера OR+XOR)
ОТЛОЖЕН по решению пользователя: пока рисуем обычной копией атласами Кида.
В документе собрано, почему в лоб не выходит (XOR несовместим с
прозрачностью #FF; операция читает ОЗУ-копию, поэтому два прохода
оригинала вырождаются в один XOR — нужен однопроходный композит
s | bg ^ s(сдвиг)), замер стоимости источника и четыре варианта.  Ключ к
выбору — список кадров, которыми тень реально пользуется; снимать по факту,
когда пойдут уровни 5/6/12.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
2026-08-11 15:41:06 +03:00
parent a823e7ee9c
commit 860468f3c5
15 changed files with 616 additions and 35 deletions
+15
View File
@@ -96,6 +96,21 @@ void _bgi_blit_rows_op_raw(const uint8_t *src, uint8_t *dst,
uint8_t w, uint8_t h,
int sstride, uint8_t y0, uint8_t op);
/* Операция NOT (приёмник = ~источник): у акселератора нет режима
* «инвертировать буфер», поэтому вторым burst'ом идёт XOR по блоку
* единиц _bgi_ones256. Отдельные ядра — цепочка не такая, как у
* AND/OR/XOR. bgi256/_bgi_blit_{rows,cols}_not_raw.c. */
void _bgi_blit_rows_not_raw(const uint8_t *src, uint8_t *dst,
uint8_t w, uint8_t h,
int sstride, uint8_t y0);
void _bgi_blit_cols_not_raw(const uint8_t *src, uint8_t *dst,
uint8_t w, uint8_t h,
int sstride, uint8_t y0);
/* Константный блок из 256 байт #FF — второй операнд NOT-цепочки
* (common/_bgi_ones256.c). */
extern const uint8_t _bgi_ones256[256];
/* КОЛОНОЧНАЯ специализация (column-major src -> экран): каждая колонка —
* вертикальный accel-burst (LD A,A, Port_Y авто-шаг); dst +1/колонку, src
* +sstride/колонку. Даёт бесплатный горизонтальный флип (sstride<0 + src
+88
View File
@@ -0,0 +1,88 @@
/*
* _bgi_blit_cols_not_raw — accel-блит КОЛОНКАМИ операцией NOT: приёмник =
* ~источник (приёмник в операции НЕ участвует). Колоночный близнец
* _bgi_blit_rows_not_raw; про то, почему NOT делается XOR'ом по блоку
* единиц, а не `CPL`, — в его шапке и в common/_bgi_ones256.c.
*
* ЦЕПОЧКА НА КОЛОНКУ (три burst'а):
* OUT Port_Y = y0
* LD L,L · LD A,(DE) ; ГОРИЗ: буфер := колонка src (смежная)
* LD B,B ; СТОП — разоружить перед сменой HL
* PUSH HL · LD HL,#ones · LD L,L · XOR (HL) ; ГОРИЗ: буфер = ~src
* LD B,B · POP HL ; вернуть адрес колонки экрана
* LD A,A · LD (HL),A ; ВЕРТ: буфер -> видео-колонка
* LD B,B
* В отличие от _bgi_blit_cols_op_raw, ВТОРОЙ OUT Port_Y здесь НЕ нужен:
* op-burst идёт по блоку единиц в ГОРИЗОНТАЛЬНОМ режиме, а Port_Y шагает
* только вертикальный. PUSH/POP выполняются под СТОПом (accel разоружён)
* — иначе обращение к стеку само стало бы триггером.
*
* ВХОД (__sdcccall(1)): src→HL, dst→DE; стек: w 4(ix), h 5(ix),
* sstride 6/7(ix), y0 8(ix) — как у _bgi_blit_cols_raw. Callee-pop 5 Б.
* Raw: без клипа, W3 замаплен снаружи, банк ставит вызывающий, src ВНЕ W3.
* Клоббер: AF/BC/DE/HL; IX сохраняется.
*/
#include "../_bgi.h"
void _bgi_blit_cols_not_raw(const uint8_t *src, uint8_t *dst,
uint8_t w, uint8_t h,
int sstride, uint8_t y0) __naked
{
(void)src; (void)dst; (void)w; (void)h; (void)sstride; (void)y0;
__asm
push ix
ld ix, #0
add ix, sp
;; SMC: размер accel-блока <- h (высота колонки)
ld a, 5 (ix)
ld (cn_len_imm), a
;; SMC: src-страйд между колонками (± на вызов даёт флип)
ld a, 6 (ix)
ld (cn_slo_imm), a
ld a, 7 (ix)
ld (cn_shi_imm), a
ld b, 4 (ix) ; B = число колонок (0 => 256: djnz)
ld c, 8 (ix) ; C = y0 (Port_Y, константа)
ex de, hl ; HL = dst (видео), DE = src (ОЗУ)
di ; один DI на весь блит
ld d, d ; 0x52 режим размера блока
ld a, #0
cn_len_imm = . - 1
ld b, b ; 0x40 стоп
cn_col:
ld a, c
out (#0x89), a ; Port_Y = y0 (верх колонки)
ld l, l ; 0x6D гориз. режим (колонка src смежна)
ld a, (de) ; read-burst : h байт src -> буфер
ld b, b ; 0x40 стоп (разоружить перед PUSH/LD HL)
push hl ; спрятать адрес колонки экрана
ld hl, #__bgi_ones256
ld l, l ; 0x6D гориз. режим
xor a, (hl) ; op-burst : буфер ^= #FF... = ~src
ld b, b ; 0x40 стоп
pop hl ; HL = адрес колонки экрана
ld a, a ; 0x7F верт. режим
ld (hl), a ; write-burst: буфер -> видео-колонка
ld b, b ; 0x40 стоп
;; src += sstride (следующая колонка источника)
ld a, e
add a, #0
cn_slo_imm = . - 1
ld e, a
ld a, d
adc a, #0
cn_shi_imm = . - 1
ld d, a
inc hl ; dst += 1 (следующий x)
djnz cn_col
ei
pop ix
;; callee-pop 5 байт (w,h,sstride:2,y0)
pop hl ; ret-адрес
pop af
pop af
inc sp
jp (hl)
__endasm;
}
+102
View File
@@ -0,0 +1,102 @@
/*
* _bgi_blit_rows_not_raw — accel-блит СТРОКАМИ операцией NOT: приёмник =
* ~источник (приёмник в операции НЕ участвует). Пара к
* _bgi_blit_rows_op_raw, вынесена отдельно, потому что цепочка другая.
*
* ПОЧЕМУ НЕ `CPL`. Буфер акселератора меняется только на ЧТЕНИИ и только
* опкодами AND/OR/XOR (HL) (драйвер MAME, update_accel_buffer); `CPL`
* (#2F) автомат не распознаёт вовсе — инвертируется регистр CPU, а не
* буфер, и запись выгрузит неизменённый блок. Зато ~src = src XOR #FF,
* поэтому NOT собирается из имеющегося: XOR-burst по константному блоку
* единиц (common/_bgi_ones256.c).
*
* ЦЕПОЧКА НА СТРОКУ (три burst'а, все горизонтальные):
* OUT Port_Y = y
* LD L,L · LD A,(DE) ; буфер := src
* LD B,B ; СТОП — разоружить перед сменой HL
* LD HL,#ones · LD L,L · XOR (HL) ; буфер ^= #FF... = ~src
* LD B,B ; СТОП
* LD HL,#dst · LD L,L · LD (HL),A ; запись строки
* LD B,B
* СТОП перед каждой загрузкой HL обязателен: под армированным accel fetch
* операнда `LD HL,nn` перезапустил бы burst (memory/
* accel_operand_fetch_retrigger). Буфер и размер блока переживают LD B,B
* (docs/new/06-accel.md §6.3) — на этом всё и держится.
* Port_Y в горизонтальном режиме не шагает, сбрасывать его между
* burst'ами не нужно; dst фиксирован (строку выбирает Port_Y) и потому
* кладётся SMC-immediate'ом один раз на вызов.
*
* Прозрачности у NOT нет по определению (инвертируется КАЖДЫЙ байт, в том
* числе #FF -> 0x00) — это ровно семантика NOT_PUT из Turbo C BGI.
*
* ВХОД (__sdcccall(1)): src→HL, dst→DE (фикс); стек: w 4(ix), h 5(ix),
* sstride 6/7(ix), y0 8(ix). Callee-pop 5 Б. Raw: без клипа, W3 замаплен
* снаружи, банк ставит вызывающий, src ВНЕ W3. Клоббер: AF/BC/DE/HL.
*/
#include "../_bgi.h"
void _bgi_blit_rows_not_raw(const uint8_t *src, uint8_t *dst,
uint8_t w, uint8_t h,
int sstride, uint8_t y0) __naked
{
(void)src; (void)dst; (void)w; (void)h; (void)sstride; (void)y0;
__asm
push ix
ld ix, #0
add ix, sp
;; SMC: размер блока <- w
ld a, 4 (ix)
ld (bn_len_imm), a
;; SMC: src-страйд между строками
ld a, 6 (ix)
ld (bn_slo_imm), a
ld a, 7 (ix)
ld (bn_shi_imm), a
;; SMC: адрес приёмника фиксирован на весь блит (строку задаёт
;; Port_Y), а HL по очереди занят то блоком единиц, то им
ld (bn_dst_imm), de
ld b, 5 (ix) ; B = счётчик строк (0 => 256: djnz)
ld c, 8 (ix) ; C = y
ex de, hl ; DE = src (читается LD A,(DE))
di ; один DI на весь блит
ld d, d ; 0x52 режим размера блока
ld a, #0
bn_len_imm = . - 1
ld b, b ; 0x40 стоп (B=счётчик не тронут)
bn_row:
ld a, c
out (#0x89), a ; Port_Y = y
inc c
ld l, l ; 0x6D гориз. режим
ld a, (de) ; read-burst : src -> буфер
ld b, b ; 0x40 стоп (разоружить перед LD HL)
ld hl, #__bgi_ones256
ld l, l ; 0x6D гориз. режим
xor a, (hl) ; op-burst : буфер ^= #FF... = ~src
ld b, b ; 0x40 стоп
ld hl, #0
bn_dst_imm = . - 2
ld l, l ; 0x6D гориз. режим
ld (hl), a ; write-burst: буфер -> строка экрана
ld b, b ; 0x40 стоп
;; src += sstride
ld a, e
add a, #0
bn_slo_imm = . - 1
ld e, a
ld a, d
adc a, #0
bn_shi_imm = . - 1
ld d, a
djnz bn_row
ei
pop ix
;; callee-pop 5 байт (w,h,sstride:2,y0)
pop hl ; ret-адрес
pop af
pop af
inc sp
jp (hl)
__endasm;
}
+53
View File
@@ -0,0 +1,53 @@
/*
* _bgi_ones256 — константный блок из 256 байт #FF: второй операнд для
* блит-операции NOT (GFX_OP_NOT).
*
* ЗАЧЕМ. У акселератора нет режима «инвертировать буфер»: буфер меняется
* только на ЧТЕНИИ и только опкодами AND/OR/XOR (HL) (см. драйвер MAME,
* update_accel_buffer). `CPL` автомат не распознаёт вовсе — он
* инвертирует регистр CPU, а не буфер. Зато ~src = src XOR #FF, поэтому
* NOT собирается из уже имеющегося: буфер := src, потом XOR-burst по
* этому блоку, потом запись.
*
* Отдельным модулем — по правилу «общие статики в свой модуль»: блок
* нужен обоим ядрам (rows и cols), а программа без NOT его не линкует.
* const => живёт в _CODE, то есть вне W3 — как и требует accel (сторона
* ОЗУ на время операции не должна быть перекрыта видеобанком).
* Размер ровно 256 — максимальный размер accel-блока.
*/
#include "../_bgi.h"
const uint8_t _bgi_ones256[256] = {
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF,
0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF, 0xFF
};
+15
View File
@@ -67,6 +67,21 @@ void _gfx_blit_full_op(int x, int y, const void *img,
src += (uint16_t)sy * (uint16_t)img_w;
dst = _gfx_addr_base + x;
/* NOT — не операция с приёмником, а инверсия источника, и цепочка у
* неё другая (XOR по блоку единиц вместо чтения приёмника), поэтому
* своё ядро. Ветка одна на вызов, в цикл по полосам не заходит. */
if (op == GFX_OP_NOT) {
while (w > 256) {
_bgi_blit_rows_not_raw(src, (uint8_t *)dst, 0 /* =256 */,
(uint8_t)h, img_w, (uint8_t)y);
src += 256;
dst += 256;
w -= 256;
}
_bgi_blit_rows_not_raw(src, (uint8_t *)dst, (uint8_t)w, (uint8_t)h,
img_w, (uint8_t)y);
return;
}
while (w > 256) {
_bgi_blit_rows_op_raw(src, (uint8_t *)dst, 0 /* =256 */, (uint8_t)h,
img_w, (uint8_t)y, op);
+8 -2
View File
@@ -89,7 +89,13 @@ void gfx_blit_cols_part_wx_op(int x, int y, const void *img, uint8_t flip,
_bgi_begin();
dst = (uint8_t *)(_gfx_addr_base + (uint16_t)x);
_bgi_blit_cols_op_raw(src, dst, (uint8_t)w, (uint8_t)h, sstride,
(uint8_t)y, op);
/* NOT — инверсия ИСТОЧНИКА, приёмник в ней не участвует: своя цепочка
* (XOR по блоку единиц) и своё ядро. Ветка одна на вызов. */
if (op == GFX_OP_NOT)
_bgi_blit_cols_not_raw(src, dst, (uint8_t)w, (uint8_t)h, sstride,
(uint8_t)y);
else
_bgi_blit_cols_op_raw(src, dst, (uint8_t)w, (uint8_t)h, sstride,
(uint8_t)y, op);
_bgi_end();
}
+15 -25
View File
@@ -8,17 +8,16 @@
* с учётом текущего банка (gfx_set_bank: 0x58 даёт аппаратную
* прозрачность 0xFF, 0x54/0x5C — временный вывод).
*
* XOR/OR/AND_PUT — тоже через акселератор (gfx_blit_part_op, 2026-08-11;
* закрыт пункт 2d-1 docs/TODO.md): акселератор умеет блочные AND/OR/XOR
* между своим буфером и памятью приёмника, попиксельного цикла CPU больше
* нет. Клиппинг у них теперь ТОТ ЖЕ, что у COPY_PUT (раньше на этом пути
* клипа не было вовсе). Оговорки — в шапке common/_gfx_blit_full_op.c:
* операция читает ОЗУ-копию экрана (при банках 0x54/0x5C это чистый фон),
* а прозрачность #FF совместима с AND/OR, но не с XOR.
* XOR/OR/AND/NOT_PUT — тоже через акселератор (gfx_blit_part_op,
* 2026-08-11; закрыт пункт 2d-1 docs/TODO.md): у железа есть блочные
* AND/OR/XOR между буфером акселератора и памятью приёмника, а NOT
* выражается через XOR по блоку единиц. Попиксельного пути в putimage
* больше НЕТ ВООБЩЕ, и клиппинг у всех пяти операций теперь одинаковый
* (раньше на непрямом пути его не было вовсе).
*
* NOT_PUT — по-прежнему по-пиксельно (пишем ~src): это не операция с
* приёмником, а инверсия источника, у акселератора такого режима нет.
* Клиппинга на этом пути НЕТ (per-pixel bounds-check только в safe).
* Оговорки — в шапке common/_gfx_blit_full_op.c: операция читает
* ОЗУ-копию экрана (при банках 0x54/0x5C это чистый фон, а не то, что
* нарисовано поверх), а прозрачность #FF совместима с AND/OR, но не с XOR.
*
* Буфер bitmap обязан лежать вне W3 (< 0xC000) — на время операции W3
* замаплен на видеобанк.
@@ -28,7 +27,7 @@
void putimage(int left, int top, const void *bitmap, int op)
{
const uint8_t *p = (const uint8_t *)bitmap;
int w, h, x, y;
int w, h;
uint8_t gop;
w = p[0] | (p[1] << 8);
@@ -36,23 +35,14 @@ void putimage(int left, int top, const void *bitmap, int op)
if (w <= 0 || h <= 0) return;
switch (op) {
case COPY_PUT:
gfx_blit_part(left, top, bitmap, 0, 0, w, h);
return;
case XOR_PUT: gop = GFX_OP_XOR; break;
case OR_PUT: gop = GFX_OP_OR; break;
case AND_PUT: gop = GFX_OP_AND; break;
default: gop = 0; break; /* NOT_PUT — попиксельно ниже */
}
if (gop) {
gfx_blit_part_op(left, top, bitmap, 0, 0, w, h, gop);
case NOT_PUT: gop = GFX_OP_NOT; break;
case COPY_PUT:
default:
gfx_blit_part(left, top, bitmap, 0, 0, w, h);
return;
}
p += 4;
_bgi_begin();
for (y = 0; y < h; y++)
for (x = 0; x < w; x++)
_bgi_plot_raw(left + x, top + y, (uint8_t)~(*p++));
_bgi_end();
gfx_blit_part_op(left, top, bitmap, 0, 0, w, h, gop);
}
+8
View File
@@ -177,6 +177,14 @@ void gfx_blit_cols_part_wx(int x, int y, const void *img, uint8_t flip,
#define GFX_OP_XOR 0xAE /* опкод `xor (hl)` */
#define GFX_OP_OR 0xB6 /* опкод `or (hl)` */
/* NOT — приёмник = ~источник (сам приёмник в операции НЕ участвует).
* Тоже через акселератор, но другой цепочкой: у него нет режима
* «инвертировать буфер» (`CPL` автомат не распознаёт — инвертируется
* регистр CPU, а не буфер), зато ~src = src XOR #FF, поэтому вторым
* burst'ом идёт XOR по константному блоку единиц (common/_bgi_ones256.c).
* Значение выбрано вне диапазона опкодов операций — это НЕ опкод. */
#define GFX_OP_NOT 0x01
/* --- строками (row-major, как gfx_blit/gfx_blit_part) --- */
void gfx_blit_op(int x, int y, const void *img, uint8_t op);
void gfx_blit_part_op(int x, int y, const void *img,