Jeden take (60.1 s), jedna oś czasu: licznik próbek PCM z capture.
Krzywa mowy policzona produkcyjnym Silero VAD (embedded ONNX,
config domyślny silnika), słowa pochodzą z
SealedSpan.words zrzuconych przez żywy tor
Apple-live w replayu — nie z żadnej rekonstrukcji.
20/20słów word-grain ≥75% na mowie
11sealed spans
2spany z per-word pinami
1clock-lie (span 2)
0.5próg Silero
Pełny przebieg — 0…60 s
Góra: obwiednia PCM. Środek: p(mowa) Silero co 32 ms z progiem 0.5
(linia przerywana). Dół: zapieczętowane spany Apple (z pinami słów
tam, gdzie SFSpeech oddał segmenty) i segmenty Whispera zmapowane
wstecz na ten sam zegar. Najedź na box, żeby zobaczyć tekst i zakres.
Zoom: span 3 — „Ten plik WAV i puścił go na" (20.7–23.5 s)
6 słów, każde z własnym zakresem próbek. Podział na litery wewnątrz
słowa to równomierna interpolacja (SFSpeech nie daje timingów
grafemów) — jawnie oznaczona, nie pomiar.
Zoom: span 9 — 14 słów (44.0–53.8 s)
Najdłuższy word-grain span take'a. Widać przerwy między słowami
pokrywające się z dolinami Silero („czarną" zaczyna się po 480 ms
ciszy — VAD i pin zgadzają się co do niej).
Każde słowo word-grain vs Silero
Udział chunków z p(mowa) ≥ 0.5 wewnątrz zakresu słowa.
span
słowo
zakres [s]
czas
mowa
#3
ten
20.70–20.94
240 ms
100%
#3
plik wave
20.94–21.93
990 ms
100%
#3
i
22.14–22.35
210 ms
75%
#3
puścił
22.35–22.92
570 ms
100%
#3
go
22.92–23.13
210 ms
100%
#3
na
23.13–23.49
360 ms
100%
#9
duże
43.98–44.28
300 ms
90%
#9
bazy
44.28–44.55
270 ms
100%
#9
kodowe
44.55–45.09
540 ms
100%
#9
przestały
45.27–45.66
390 ms
85%
#9
być
45.66–45.81
150 ms
100%
#9
tajemnicą
45.81–46.59
780 ms
100%
#9
i
46.59–47.31
720 ms
100%
#9
czarną
47.79–48.15
360 ms
75%
#9
dziurą
48.15–48.57
420 ms
100%
#9
dla
49.20–49.89
690 ms
100%
#9
agentów
49.89–50.25
360 ms
100%
#9
jaj
50.25–50.52
270 ms
100%
#9
korzysta
52.20–52.62
420 ms
100%
#9
z Ruska
52.62–53.79
1170 ms
100%
Uczciwe wnioski
Piny są prawdziwe tam, gdzie istnieją. 20/20 słów z per-word
pinami leży w ≥75% na chunkach mowy wg Silero; minimum to 75% („i",
210 ms — krótkie spójniki łapią sąsiadującą ciszę). Czasy trwania są
fizjologiczne (150–990 ms na słowo).
Dwie klasy ziarna. Tylko 2 z 11 spanów mają per-word piny —
SFSpeech oddaje segmenty kapryśnie; pozostałe spany niosą jeden
„word" o ziarnie całego utterance. Per-word payload jest więc
realny, ale nie gwarantowany.
Span 2 to kłamstwo zegarowe na żywym okazie: 41 znaków
przypięte do 100 ms (410 znaków/s — fizycznie niemożliwe). To ten
sam rodzaj rozjazdu, który łapią WARN-y „seal window unresolved".
Silero mówi „mowa 100%", ale zakres nie jest zakresem tej mowy.
Utterance-grain spany zawierają ogony ciszy (span 8: 36%
mowy) — zakres spanu to odległość między commitami Apple, nie obrys
mowy. Dokładnie dlatego W13-3B chce mintować tożsamości z krawędzi
ciszy Silero.
Litery = interpolacja. Rozbicie liter jest równomiernym
podziałem zakresu słowa, oznaczonym na grafie; realne timingi
grafemów wymagałyby forced-alignera — nie udajemy, że je mamy.
Źródła: CODESCRIBE_SEAL_ATLAS_DUMP (nowa
powierzchnia dowodowa w apple_live_session) +
vad_atlas_probe (nowy example w core). Sesja
replay cff0817b…, sample_rate 44100 Hz, 2650112 próbek.