18/04/25 16:01:07.60 5sIIQOD0.net
Windows 10 機能更新プログラム (2018 Spring Release) における元号のレジストリ更新について – Japan New Era Name Support Blog
URLリンク(blogs.technet.microsoft.com)
「??」ってさあ……もうちょっと、こう、何か無かったのか。
201:デフォルトの名無しさん
18/04/26 10:43:23.40 suNaxvFr.net
Googleが銃の絵文字を水鉄砲へ変更
URLリンク(blog.emojipedia.org)
202:デフォルトの名無しさん
18/04/26 15:21:01.42 dlfZTwzS.net
>>196
でもどうしたらよかったんだろう
203:デフォルトの名無しさん
18/04/26 16:11:58.36 obVS20md.net
>>197
これはひどい
204:デフォルトの名無しさん
18/04/26 19:04:18.92 B7OLP04x.net
戦争の場が宇宙に移ったということだろう
水鉄砲というよりもSFにありそうなレーザーガンっぽいしw
205:デフォルトの名無しさん
18/04/26 19:35:12.68 vM7mL5EC.net
なぶるとかの漢字も狩られちゃうー
206:デフォルトの名無しさん
18/04/27 04:11:19.93 W2h8WuA6.net
過去の文献のニュアンスが変わってしまいそうだが大丈夫か……
207:デフォルトの名無しさん
18/04/27 07:59:57.84 .net
卍が表示できなくなるのはいつですか?
208:デフォルトの名無しさん
18/04/27 17:46:31.89 ash3pEtl.net
発電所の記号もだめか
209:デフォルトの名無しさん
18/04/27 17:59:20.13 l9wD2n6W.net
>>203
双輪にしたらどうかな?www
210:デフォルトの名無しさん
18/04/28 14:21:23.68 sM690dJm.net
絵文字のデザインなんて前からコロコロ変わるゆるふわなものだってことじゃないの
U+1F3B1 BILLIARDS は例示ではキューと積まれたボールのデザインだったのに各メーカーは何が気に入らなかったのか知らんけど「8ボール」のデザインで実装
仕方ないので Unicode 12.0 では例示字形を変更し元々のキュー&ボールは U+1F93F BILLIARD GAMES として新たに追加(予定)とか
もう何でもありだなって思うわ。
211:デフォルトの名無しさん
18/04/28 17:41:47.97 h8rwEw9O.net
モヤイとか昔から出しな
212:デフォルトの名無しさん
18/04/29 04:53:57.13 4Tl9MZgN.net
毛沢東とかもそうだが
馬鹿ほど文字を替えたがる
213:デフォルトの名無しさん
18/04/29 22:48:21.31 JU8sokja.net
元々auの絵文字が文字名はモヤイだけどグリフイメージがモアイだしなあ
そんでもってdocomo/Softbankへ送ると[モアイ]になるんだっけ?どっちだよw
214:デフォルトの名無しさん
18/04/30 04:31:43.91 5AUwFsoY.net
モヤモヤするなあ
215:デフォルトの名無しさん
18/04/30 12:14:27.36 5HYSW1VB.net
モアモア
216:デフォルトの名無しさん
18/05/01 21:01:23.78 L301k72M.net
新元号への対応に向けた検証とテスト ケースについて
URLリンク(blogs.technet.microsoft.com)
現時点で新元号は発表されておりませんが、新元号に対しても合字を用意すべく、
弊社では Unicode コンソーシアムや日本政府、業界団体とともに
Unicode 上の文字コードの確保や新しい字形の作成、フォントの更新について準備を進めております。
新しい合字のコード ポイント等については未確定の状況
217:でございますが、 今一度、下記のような合字の表示、入力に問題がないかご確認ください。 また新元号の発表後に追加される合字を正しく表示するためにはフォントの更新 (合字のグリフの追加) が必要となりますため、 アプリケーションにてご使用のフォントについても確認が必要と想定されます。 - ㍻ (U+337B) - ㍼ (U+337C) - ㍽ (U+337D) - ㍾ (U+337E) また、合字を含めた検索や並べ替えについては、少々考慮が必要です。 弊社の Web 検索 "Bing" では、"㍻" を検索した際 ”㍻” と ”平成” の両方が検索されます。 一方、Word では "㍻" の検索の際には "㍻" のみが検索されます。 検索や並べ替えの動作についても正規化処理の状況によって異なる結果となることが予想されますため、 ご確認をいただくことをお勧めいたします。
218:デフォルトの名無しさん
18/05/01 21:40:31.70 .net
年号に合字コード用意するのやめようぜ
普通に2文字使えばいいじゃん
どうしても組文字にしたければフォントじゃなくて
ワープロソフトとかDTPソフトにやらせてくれよ
219:デフォルトの名無しさん
18/05/02 08:28:01.76 6hVpEKUT.net
URLリンク(twitter.com)
そういえば、MSKKの社員だった時代(1990年頃)、自分のまわりにいた日本人の技術者は全員元号のサポートに反対だった。
元号を入れたがったのはアメリカ本社のアメリカ人技術者。
日本人はそんなものサポートしたって面倒が増えるだけだと分かっていたけど、
各国の伝統文化を尊重したというポーズを取って得点を稼ぎたいアメリカ人とは利害が違ったのだと思う。
220:デフォルトの名無しさん
18/05/02 10:27:09.46 dVOVl8hd.net
フォントで合字するのは別にいいよ
わざわざ文字コードに入れるのがアホなんや
221:デフォルトの名無しさん
18/05/02 15:41:15.94 GW3J9sAd.net
佳子のもはよ
222:
18/05/02 18:53:41.71 R3g8E+PO.net
>>214
アメリカ左翼の弊害は底知れないね
223:デフォルトの名無しさん
18/05/03 01:34:21.57 lB3Qws3m.net
>>214
その「元号のサポート」って機種依存文字エリアに合字の年号を入れることを指してる?
時刻の表示形式の「平成XX年XX月XX日」みたいなののことじゃ・・・
合字は伝統文化じゃないよね別に
224:デフォルトの名無しさん
18/05/03 22:41:08.91 zfa+xthz.net
合字に関しては、直前2文字の表示幅を半分にする制御文字を追加すればいい気がする。
絵文字で肌色指定する制御文字がすでにあるので、それと同じ。
システムにフォント表示幅を変える機能が必要ではあるけど。
225:デフォルトの名無しさん
18/05/03 22:43:07.70 7QWVobnZ.net
>>219
>絵文字で肌色指定する制御文字がすでにある
そんなものあるの?Unicodeの理念からどんどん遠ざかっている気がする
226:デフォルトの名無しさん
18/05/03 22:49:28.42 zfa+xthz.net
>>220
肌の黒い中国人とか表示可能。
👲👲🏻👲🏼👲🏽👲🏾👲🏿
227:デフォルトの名無しさん
18/05/03 23:02:39.59 zfa+xthz.net
あー失礼。直前2文字ごとじゃなくて直前1文字ごとに設定すればいいだけか。
228:デフォルトの名無しさん
18/05/04 00:29:10.94 .net
>>219
ゼロ幅接合子が漢字を対象に使われた場合は、その漢字同士で合字を作るようにすればいい
229:デフォルトの名無しさん
18/05/04 02:22:41.61 hkSS9FCA.net
1文字単位で半角幅化できれば合字いらなくなるでしょ。
230:デフォルトの名無しさん
18/05/04 02:36:16.61 9i+OMC2T.net
峠か
231:デフォルトの名無しさん
18/05/04 07:21:22.23 u9M1T9G6.net
文字幅セレクタなんてもんができてしまったら
EAWもfullwidth
232:領域もなんだったんだってことになるだろw
233:デフォルトの名無しさん
18/05/04 09:03:45.93 .net
>>224
合字じゃないと縦書きのとき困る
234:デフォルトの名無しさん
18/05/04 11:52:27.49 J+Z5/byg.net
単純に幅半分にしたら縦と横の線の太さがチグハグになりそう
フォント屋が頑張って調整すればいいか
235:デフォルトの名無しさん
18/05/04 18:46:40.30 hkSS9FCA.net
ネ申 → 神
236:デフォルトの名無しさん
18/05/04 18:55:49.29 hkSS9FCA.net
>>228
白黒の2色じゃなくて中間色を使うアンチエリアスが必要。
フォント屋の仕事じゃなくてOSレベル(例:WindowsのClearType)の範疇。
印刷時の見栄えを一致させるには、当然、印刷機も中間色への対応が必要。
237:デフォルトの名無しさん
18/05/04 20:48:04.97 hEI+4DHq.net
縦倍角 横倍角 四倍角てのをふと思い出したわ
238:デフォルトの名無しさん
18/05/04 21:04:25.47 SdH3E9b0.net
正体を単純に長体にすると視認性が落ちるからとCondensedやCompressedな書体を作ってるデザイナーが見たらガックリくるような話だな
239:デフォルトの名無しさん
18/05/04 21:36:34.74 6o7jBY6i.net
このネタいつまで引っ張っても元号に文字コード割り当てようという考えが如何に頭が悪いかということを思い知らされるだけだ
240:デフォルトの名無しさん
18/05/05 04:12:58.69 fc3S9c8B.net
少なくとも期間情報も含めないと意味無いし
241:デフォルトの名無しさん
18/05/05 09:14:26.61 .net
これでその時点の元号を表示すればいいのか
<日本の元号を表すコード(共通)> <西暦年(100の位 : 6~20)を表す制御コード> <西暦年(0~99)を表す制御コード> <月(1~12)を表す制御コード> <日(1~31)を表す制御コード>
242:デフォルトの名無しさん
18/05/05 09:15:06.04 fc3S9c8B.net
なるほど
243:デフォルトの名無しさん
18/05/05 13:12:46.35 DMAq375N.net
文字コードとプログラミングの区別ができない人は、このスレに書き込まないほうがいい。
244:デフォルトの名無しさん
18/05/05 17:28:35.54 JV+fv9fZ.net
>>235
順序はあるんだから
日本の元号を表すコード(共通)> <順序数コード>
で済むよね
245:デフォルトの名無しさん
18/05/05 21:59:51.63 BTViOdFG.net
南北朝時代どうすんだ
246:デフォルトの名無しさん
18/05/05 22:12:48.38 DMAq375N.net
全角文字を半角の幅で表示したい潜在需要は、中国や韓国にもあると思うます。
247:デフォルトの名無しさん
18/05/05 23:45:45.90 gS+4uwRv.net
全角文字という概念がそもそも頭悪い感じ
248:デフォルトの名無しさん
18/05/06 00:56:49.53 jLP2IXjH.net
7pt文字から36pt文字までコードを割り当てれば十分だと思う。
249:デフォルトの名無しさん
18/05/06 02:15:11.15 .net
>>239
<日本の元号を表すコード(共通)> <王朝を表す制御コード> <西暦年(100の位 : 6~20)を表す制御コード> <西暦年(0~99)を表す制御コード> <月(1~12)を表す制御コード> <日(1~31)を表す制御コード>
250:デフォルトの名無しさん
18/05/06 05:44:27.92 1UjbZZkI.net
「制御コード」? 普通の2進コードじゃイカンのか?
251:デフォルトの名無しさん
18/05/06 07:32:19.99 .net
Unicodeの仕組みをよく知らないので
普通の2進コードを書けるならそれで
252:デフォルトの名無しさん
18/05/06 08:53:27.43 xzPVvKwY.net
そんなコード作ったところで検索もできないし、妄想の域にすらない
そもそも漢字で書ける元号に合字が必要かって話だし、まったく方向がおかしい
253:デフォルトの名無しさん
18/05/06 09:21:27.15 p3sWeeXN.net
ID隠してる奴なんてあぼーんしとけ
おかしなやつに構う奴も荒しだからな
254:デフォルトの名無しさん
18/05/06 16:41:35.33 89R5dh0N.net
てすと(´・ω・`)
(´◉◞౪◟◉)
255:デフォルトの名無しさん
18/05/07 01:07:40.66 POBoMmsZ.net
Unicodeの次の概念とかはまだないのかな。それとももうみんなUnicodeに満足してしまっているのかね。
256:デフォルトの名無しさん
18/05/07 01:12:52.35 JfD99IBd.net
universeの次がmultiverseなんだから次はmulticodeだろうね。
それかikuracode
257:xn--n8jz80gzejou5c
18/05/07 02:29:48.88 UwQrgiVu.net
Progressive Unicode、略してPunicode
258:デフォルトの名無しさん
18/05/07 02:33:09.58 /2aX4qzY.net
glicoodeというやつが開発されてなんか賞取ってた気がする
259:デフォルトの名無しさん
18/05/07 09:24:31.55 h5B8tWuv.net
もう変な合成記号類は多数あるし、漢字合字開始、漢字合字終了の2文字だけ定義しとけばいいんじゃないかな。
そうすれば未来永劫大丈夫だ(フォントさえ準備すれば)。北の人とかでも使えるし、なんなら金印とかハンコとかも好きなだけ合成できる。
260:デフォルトの名無しさん
18/05/07 11:16:00.13 POBoMmsZ.net
>>252
グリコが開発したプログラミング言語じゃないの?
文字コードと関係なくね?
261:デフォルトの名無しさん
18/05/07 13:40:44.12 HIVeR9DH.net
>>252
> glicoodeというやつが開発されてなんか賞取ってた気がする
o が1つ多すぎる
正しくは glicode
ポッキーの並べ方でプログラミングするって奴ね
詳しくは次のページを参照
URLリンク(cp.glico.jp)
262:デフォルトの名無しさん
18/05/07 14:05:14.59 QMgv+0U5.net
「祇園」のフォントというかグリフって間違ってるよね?
Win10とAndroidは同じっぽいけどどっちも間違いの気がする
263:デフォルトの名無しさん
18/05/07 15:39:21.55 tXPpG5gL.net
>>239
20年以上前にとあるDBマネジメントシステムに関わっていたんだけど、和暦対応を導入しようかって話が出てときに南北朝の話で揉めたよw
あの時はどうやって解決したんだっけかな……西暦→和暦変換の関数にオプションを付けたんだっけかな? (覚えてないやゴメン)
264:デフォルトの名無しさん
18/05/07 16:11:49.95 owHHQ9fb.net
>>257
明治5年以前は今使われている太陽暦とは違う暦、太陰太陽暦が使われていたんだけど
その変換はどうしてたんだろ
265:デフォルトの名無しさん
18/05/07 19:00:55.62 tXPpG5gL.net
スレ違い気味の自覚はあるのでほどほどにしときます……
>>258
和暦と西暦の相互変換が出来れば十分という要件だったので、それほど困らなかった気が。
西暦→和暦の変換は問題ないよね?
んで、和暦→西暦の変換では存在しない日付を指定したらエラーにしていたんじゃなかったかな。
(例:明治5年12月3日は存在しないため、西暦に変換しようとしてもエラー)
なお上記では西暦と表記してるけど、実際にはグレゴリオ暦とユリウス暦の違いを意識していた記憶がある。
ただし、どうやって解決していたのか思い出せない…… (使えなくてすみません)。
266:デフォルトの名無しさん
18/05/08 16:23:34.87 75TKeVia.net
どうせスレチなら現代でも太陰暦に変換するツールが必要
267:デフォルトの名無しさん
18/05/08 17:04:12.21 K6jgn725.net
例えば1月30日が存在するかどうかは年ごとに違っていたそうな
URLリンク(ja.wikipedia.org)
>太陰太陽暦では月の満ち欠けに基づく「30日」と「29日」の二つであり、
>「30日」を「大の月」、「29日」を「小の月」とする。
>しかもこの月の大小は、月の満ち欠けの仕方などによってその順番が年ごとに変わる。
>太陰太陽暦ではこの太陰暦の12ヶ月に、約3年に一度、1ヶ月を加え13ヶ月とし、
>季節とのずれをなるべく少なくする調整をする。この挿入された月を「閏月」という。
>しかしながら閏月をどの時期に入れるかについては、同じ時代でも地域によって食い違うことがあった。
>例えば日本では古来より西日本では伊勢暦、東日本では三島暦が主に用いられたが、
>時として閏月を挿入する時期が異なっていたので、日本国内で日付の異なる暦を使っていた事がある。
268:デフォルトの名無しさん
18/05/08 17:15:53.32 75TKeVia.net
今年は閏月抜いた方が良いくらい季節ずれてる
269:デフォルトの名無しさん
18/05/08 22:52:47.16 kruQSPFC.net
結局Alternative Unicodeはまだ存在しないのか……。
Unicodeの制定が1993年なことを考えると、そろそろ別の規格が立ち上がってもいい筈なんだけどな。
Unicodeの仕組みが余程完璧ならいざしらず。
270:デフォルトの名無しさん
18/05/08 23:24:51.35 91gJGUDl.net
Adobe、Apple、Facebook、Google、IBM、Microsoftといったコンピュータ業界の大会社がUnicode作ってるからなぁ
(実際あるのか知らないけど)他の方面からの立ち上がりに期待するしかないかと。
271:デフォルトの名無しさん
18/05/10 04:31:42.39 zLx1ZI77.net
ローマ数字グリフはUnicodeではCJK互換用文字のように使用が推奨されないとどこかで読んだ記憶があるのですが、間違いでしょうか。
Wikipediaの当該項目を見てもそんなことは書いておらず、困惑してます。
もしも間違いなら積極的にローマ数字グリフを使っていきたいのですが……。
272:デフォルトの名無しさん
18/05/10 13:12:41.31 MJdiSWqC.net
>>265
もしかして、これかな?
以下のページに「ただし、Unicodeの仕様では、これらは互換性用の文字であり、対応するラテン文字を用いる方が良いとされています。」という記載がある。
ローマ数字 - CyberLibrarian
URLリンク(www.asahi-net.or.jp)
Unicode Chart で Roman numerals (U+2160とか) を見てみると Compatibility decomposition mapping としてラテン文字が記載されている。
これを以って上記ページの筆者が「ラテン文字を用いる方が良い」と記載しているのなら、それは解釈が正しくないように思う。
あくまでも互換性があるよ、というだけの注記だと思うのだがどうだろうか。
ちなみに Compatibility decomposition mapping の説明は、こちら。
↓
Code Charts - Help and Links
URLリンク(unicode.org)
273:デフォルトの名無しさん
18/05/10 14:54:38.17 jFp8HxnE.net
ふむ
274:デフォルトの名無しさん
18/05/10 16:16:02.53 buMLMZ9N.net
互換分解が設定されてるだけか
275:265
18/05/11 06:21:03.11 LO7h3Lm8.net
>>266
ありがとうございます。理解できました。
276:デフォルトの名無しさん
18/05/13 14:16:53.12 dvjI0llt.net
改元後も「平成」利用へ 納税や年金システム、混乱回避
URLリンク(www.asahi.com)
277:デフォルトの名無しさん
18/05/15 05:04:52.91 vxb29Zje.net
Unicodeの漢字構成文字ってどういうときに使うか分かりますか?
278:デフォルトの名無しさん
18/05/15 05:05:59.52 vxb29Zje.net
すいません。漢字構成記述文字列のことです。
279:デフォルトの名無しさん
18/05/16 16:21:48.39 MnaY7anS.net
18.2 表意の説明の文字
表意文字説明文字: U+2FF0–U+2FFB
Unicode Standardには75,000以上のCJK統一的な表意文字が含まれていますが、非常にまれなCJK表意文字の何千もの文字はエンコードされていません。
エンコードのための追加の表意文字の目録の研究は続けられているが、潜在的な符号化可能な表意文字のセット全体が完全に使い果たされることはないと予想される。
特に、表意文字は引き続き作成され、そのような新しい硬貨は常にエンコードされません。
表意文字記述ブロックの12文字は、符号化されていない表意文字を参照する必要があるテキストの標準的な交換の仕組みを提供します。
エンコードされていない表意文字は、これらの文字と符号化された表意文字を使用して記述できます。読者はその記述から表意文字の精神的な絵を作成することができる。
このプロセスは、表意文字の正式な符号化とは異なります。符号化されていない表意文字の標準的な記述はありません。
記述された表意文字に割り当てられた意味はない。記述された表意文字には同値が定義されていません。概念的には、表意文字の説明は、
文字列<U+0065、U+0301>より英語のフレーズ「an ‘e’」に鋭いアクセントを付けたものに近い。
特に、表意文字記述ブロック内の文字のサポートでは、レンダリングエンジンは記述された文字のグラフィック外観を再作成する必要はありません。
また、ユーザーが表意文字を使用して表す可能性のある表意文字の多くは、Unicode標準の将来のバージョンで正式にコード化されることにも注意してください。
280:デフォルトの名無しさん
18/05/16 16:22:58.76 MnaY7anS.net
表意記述アルゴリズムは、実質的に全てのCJK表意文字を、それ自体が表意文字であるより小さな部分に分解することができるという事実に依存する。
Unicode標準ですでにエンコードされている表意文字の広い範囲は、符号化されていない表意文字の大部分が表意文字を使用して表現できることを意味します。
表象記述シーケンスは、主に符号化されていない表意文字を表すことを目的としていますが、符号化された表意文字を表すためにデータ交換に使用すべきではありませんが、教育的および分析的用途もあります。
たとえば、研究者は、U+86D9 蛙を「虫圭」としてデータベースに表現して、U+5A03 娃などの音声を共有する他の文字との間のリンクを提供することができます。
IRGは、このような方法で表意記述シーケンスを使用して、現行の作業のための、機械によって生成された最初の近似を提供するのに役立てています。
281:デフォルトの名無しさん
18/05/17 01:28:29.13 zp+h7fJf.net
Google翻訳ですか?
282:デフォルトの名無しさん
18/05/17 12:27:06.84 HY+Xmele.net
リンク貼るだけのレスの方がましだな
283:デフォルトの名無しさん
18/05/18 14:45:32.55 Eucqc6d6.net
>>265 で「CJK互換用文字のように使用が推奨されない」とあるけど、その根拠ってどこにあるのか分かる方いますか?
日本語ウィキペディアには「後方互換性のために収録されており使用は推奨されない」と書かれてるけど、その根拠が明示されてないんですよね。
一応注釈も記載されてはいるんだけど、>>266と同じような資料なので「使用は推奨されない」とは読み取り難い気がする。
そこで英語ウィキペディアを見に行くと「for compatibility with east Asian character sets」とだけ書かれていて、「使用は推奨されない」という旨は一言も書いてない。
とまあ、こんなわけなので、この迷える子羊にどなたかご教示ください。
284:277
18/05/18 14:51:49.75 Eucqc6d6.net
いけね、URL を貼り忘れてた。
CJK互換用文字 - Wikipedia
URLリンク(ja.wikipedia.org)
CJK Compatibility - Wikipedia
URLリンク(en.wikipedia.org)
285:デフォルトの名無しさん
18/05/20 21:42:19.91 k7uIgkh0.net
10646/Unicodeでは非推奨とまでは定めていないと思うよ
ローマ数字はShift_JISだと化けやすいんでローマ数字の使用そのものが悪みたいに
思ってる人がいるだけだと思う
286:デフォルトの名無しさん
18/05/20 22:44:23.30 SBKTPpMQ.net
0点、1点、2点、…とかMS明朝やゴシックに入ってるのを最初見た時、試合等の点数を表すためのものかと思ってた。
でも名称を調べて違う事を知った。そしてそれらは中国語のためのもので中国語では時刻の○時が○点になることも。
287:デフォルトの名無しさん
18/05/21 10:10:37.23 PPw/imVw.net
>>280
288:デフォルトの名無しさん
18/05/21 10:11:23.00 PPw/imVw.net
すまん送信ミス
>>280
初耳だった。俺もずっと日本語圏向けかと思ってたわ
289:デフォルトの名無しさん
18/05/21 10:13:27.36 6DKDYwaD.net
0点
やり直せ
290:デフォルトの名無しさん
18/05/21 12:38:29.27 3MQFDVVp.net
日本語フォントの場合は点を時に
韓国語フォントの場合は시に
繁体字フォントの場合は點に
はダメなんだろうか。
291:デフォルトの名無しさん
18/05/21 13:07:55.25 5HdLEL73.net
日本語フォントの場合は時を時に
韓国語フォントの場合は時に
繁体字フォントの場合は時に
はダメなんだろうか。
292:デフォルトの名無しさん
18/05/21 15:22:15.07 XnV9ry7u.net
CJK互換文字非推奨とかローマ数字非推奨とか、根拠の乏しいアピールがあちこちにあるのが気持ち悪い。
自分の好みを主張するのは構わないけど、Unicode でそのように提言されているかのように振る舞うのは気に入らない。
……という気持ちはどこにぶつければよいのだろうか?
293:デフォルトの名無しさん
18/05/21 15:47:01.21 h7wqMmMV.net
取り敢えず>>266のリンク先の作者にぶつけるべきでは
294:デフォルトの名無しさん
18/05/21 21:39:44.96 owdLx3Iu.net
㌀㌁㌂㌃㌄㌅㌆㌇㌈㌉
㌊㌋㌌㌍㌎㌏㌐㌑㌒㌓
㌔㌕㌖㌗㌘㌙㌚㌛㌜㌝
㌞㌟㌠㌡㌢㌣㌤㌥㌦㌧
㌨㌩㌪㌫㌬㌭㌮㌯㌰㌱
㌲㌳㌴㌵㌶㌷㌸㌹㌺㌻
㌼㌽㌾㌿㍀㍁㍂㍃㍄㍅
㍆㍇㍈㍉㍊㍋㍌㍍㍎㍏
㍐㍑㍒㍓㍔㍕㍖㍗㍘㍙
㍚㍛㍜㍝㍞㍟㍠㍡㍢㍣
㍤㍥㍦㍧㍨㍩㍪㍫㍬㍭
㍮㍯㍰㍱㍲㍳㍴㍵㍶㍷
㍸㍹㍺㍻㍼㍽㍾㍿
295:デフォルトの名無しさん
18/05/21 21:42:15.10 owdLx3Iu.net
㎀㎁
㎂㎃㎄㎅㎆㎇㎈㎉㎊㎋
㎌㎍㎎㎏㎐㎑㎒㎓㎔㎕
㎖㎗㎘㎙㎚㎛㎜㎝㎞㎟
㎠㎡㎢㎣㎤㎥㎦㎧㎨㎩
㎪㎫㎬㎭㎮㎯㎰㎱㎲㎳
㎴㎵㎶㎷㎸㎹㎺㎻㎼㎽
㎾㎿㏀㏁㏂㏃㏄㏅㏆㏇
㏈㏉㏊㏋㏌㏍㏎㏏㏐㏑
㏒㏓㏔㏕㏖㏗㏘㏙㏚㏛
㏜㏝㏞㏟㏠㏡㏢㏣㏤㏥
㏦㏧㏨㏩㏪㏫㏬㏭㏮㏯
㏰㏱㏲㏳㏴㏵㏶㏷㏸㏹
㏺㏻㏼㏽㏾㏿
296:デフォルトの名無しさん
18/05/21 21:59:03.03 V+3Z+fIi.net
頭がおかしくなりそうだ
297:デフォルトの名無しさん
18/05/21 22:38:58.14 x+xM1a4p.net
絵文字テスト😁
298:デフォルトの名無しさん
18/05/21 22:58:22.68 kKTehq+9.net
>>288
2バイト文字ってやはり狂っているな
なぜこのようなものまで一字で表示しようと考えたのか…
一字にすることで容量を節約できると考えたのだろうが、
その節約のために無駄な手間暇がかかり結果的にマイナスにしかならないという
299:デフォルトの名無しさん
18/05/21 23:23:05.67 XnV9ry7u.net
そんな餌で俺様が釣られクマ― (AA�
300:ェ) >>286 これは同意。都合良く乗っかているのは不快だね。 Unicodeを嫌ったりするのは個々の自由だけど、その概念を人々に誤認させるやり口は卑怯だ。 >>292 揚げ足だけど、話の流れ的には2バイトじゃないです…… あと互換文字の存在が許せない派の人々って、結合文字や絵文字も絶滅させたいと思っているのだろうか。 まあ絵文字が気に入らない人は多数いるのだろうとは思うw
301:デフォルトの名無しさん
18/05/22 00:22:22.07 3h/yZ372.net
肌色テスト👮
👮🏻👮🏼👮🏽👮🏾👮🏿
302:デフォルトの名無しさん
18/05/22 00:47:54.81 .net
○囲み文字の1字版と2字版のテストもおながいします
303:293
18/05/22 00:49:04.48 pl4uFglU.net
酔った勢いでレスしたら自演だった……恥ずかしい (いきなり酔いが覚めた)。
つまんないことしちゃってごめん、しばらく自重します。
304:デフォルトの名無しさん
18/05/22 04:36:23.18 XuSnYVx6.net
絵文字そのものはどうとも思ってないけど
通常の文章の中で使われる矢印がある種の入力環境だと絵文字で入力されるみたいで
「←このように」が「⬅このように」ってなるのがすごく気持ち悪い。UnicodeというよりIMEに対する不満。
305:デフォルトの名無しさん
18/05/22 11:48:04.68 3h/yZ372.net
全角チルダがwindowsユーザーとmacユーザーで違うのも厄介
windows ~
mac 〜
306:デフォルトの名無しさん
18/05/22 11:57:18.21 xGwd/XeK.net
①②③④⑤⑥⑦⑧⑨⑩⑪⑫⑬⑭⑮⑯⑰⑱⑲⑳
307:void
18/05/22 13:21:47.84 XuSnYVx6.net
>>299
〓〓〓〓〓〓〓〓〓〓〓〓〓〓〓〓〓〓〓〓
文字化けしてますよ。
308:デフォルトの名無しさん
18/05/22 13:35:03.46 d3LCNcLv.net
オマエガナー
309:デフォルトの名無しさん
18/05/22 13:36:25.53 1HkhrVs+.net
プッ
310:デフォルトの名無しさん
18/05/22 14:15:36.11 3h/yZ372.net
化けてますよ。
👻 🎃 👹 👺 👽 💀 🧛 🧟
311:デフォルトの名無しさん
18/05/22 14:35:44.60 xGwd/XeK.net
🏇̪鹿
🐎鹿
🐴鹿
312:デフォルトの名無しさん
18/05/22 14:45:39.70 3h/yZ372.net
ひょっとしてバカなの?
🏇🦌
🐎🦌
🐴🦌
313:デフォルトの名無しさん
18/05/22 18:00:59.35 KBN0pglL.net
>>305
化けてんぞバーカwwwww
314:デフォルトの名無しさん
18/05/22 18:47:42.14 XuSnYVx6.net
ということにしたいのですね
315:デフォルトの名無しさん
18/05/23 02:23:03.50 Z0QXrqgL.net
unicode と ISO10646 は互換性があるけど適用範囲とか微妙に違ったりする。
非推奨とかはISO/JISの方を念頭に置いた話ではなかろうか。
316:デフォルトの名無しさん
18/05/23 18:48:25.05 2DlA2Ju+.net
ローマ数字の話だよね?
ISO/IEC 10646にもそんな規定は無いような……コードチャートはUnicodeと同じもの使ってるし。
JIS X 0221の方は真面目に読んでないからよく分からんが……
でもISO/IEC 10646の国際一致規格な以上日本独自でそんな規定は入ってないと思うけど。
317:デフォルトの名無しさん
18/05/24 01:13:38.27 Nk0sJPwS.net
>>309
私は話題に割り込んだだけで、話題の出処がどこか知らないのでローマ数字限定かわからないけど、
「組」や「日本語文字レパートリ」とか、その辺の話が歪んでか大げさかで伝わってるじゃないかと。
318:デフォルトの名無しさん
18/05/24 01:29:22.08 fftgGS82.net
ここにはまだ来てないのか
319:デフォルトの名無しさん
18/05/24 14:00:09.03 A4JtYMZ4.net
ローマ数字やCJK互換用文字が「推奨されない」という記述がブログやWikipediaに散見されるけど、それって根拠が無いよね? という話だと思って眺めてるよ。
こういう聞こえの良いデマを否定するのは体力がいるから面倒そうだよなー
320:
321:デフォルトの名無しさん
18/05/24 14:03:05.24 fftgGS82.net
ⅠⅡⅢⅣⅤⅥⅦⅧⅨⅩⅪⅫ
Ⅽ
Ⅿ
ↂ
322:デフォルトの名無しさん
18/05/25 01:56:34.37 562g8vT6.net
>>312
いつものネット伝言ゲームじゃないか?
日本語での利用を前提として、うろ覚えだけど
1. ISO10646とユニコード規格は厳密に言えば同じではない(事実)
2. ISO10646 は部分実装を許しているための全ての文字が等価ではない(事実)
3. ISO/JIS は部分実装のために日本語向けの文字の組を決めてる(事実)
4. ユニコード実装するならば、日本語向けの文字の組のうち主要なもにには対応すべき(たんなる日本人の願望)
5. ネットなどで不特定多数との通信する前提の場合には、主要な組に入ってない文字は相手側で読めない可能性があるので推奨しない(どこかの個人の意見ならわからなくもない)
6. 日本語のための文字の組にはローマ数字は含まれていない(微妙、ISO規格本体にはまだ入ってないが、JISの参考になら含まれた気がする)
...
中略
...
99.ユニコード規格でローマ数字は推奨されない(デマ)
323:デフォルトの名無しさん
18/05/26 14:41:00.14 OAwkZ9ha.net
> 6. 日本語のための文字の組にはローマ数字は含まれていない(微妙、ISO規格本体にはまだ入ってないが、JISの参考になら含まれた気がする)
昨年末の ISO10646の改訂でJISが参考で定義していた COMMON JAPANESE も正式にISO規格に取り込まれた模様。
ということでローマ数字は BASIC JAPANESE には含まれてないけど COMMON JAPANESE には含まれてるくらいの位置付け。
324:デフォルトの名無しさん
18/05/26 22:58:23.91 oSB4DgY3.net
285 BASIC JAPANESE と 287 COMMON JAPANESE が 10646 に入ったのは10年前の ISO/IEC 10646:2003/Amd 3:2008 じゃないの?
昨年末の改訂とか正式にISO規格にって何の話?
325:デフォルトの名無しさん
18/05/26 23:54:42.44 OAwkZ9ha.net
もう JIS参考でも、amd でもなくて、正式規格本体にあるよ。情報古かったという話。
Amd3:2008 にあるんなら正式規格 ISO/IEC 10646:2012 にもあるかもしれん。確認できんけど。
326:デフォルトの名無しさん
18/05/27 10:24:34.33 rLKmcl7g.net
規格本体に入ったのは ISO/IEC 10646:2011
327:デフォルトの名無しさん
18/05/28 01:39:25.84 Ci0ddO0a.net
>>286,312
CJK互換文字のラウンドトリップ用のものはUnicode規格書に明記されてる
> They are included in the Unicode Standard to provide full round-trip compatibility
> with the ideographic repertoire of ... and should not be used for any other purpose.
URLリンク(www.unicode.org)
328:デフォルトの名無しさん
18/05/28 13:25:04.14 +smoTcYJ.net
「推奨しない」でたね
329:デフォルトの名無しさん
18/05/28 14:52:12.71 AZENlZb2.net
素晴らしい。こういうちゃんとした情報は歓迎するよ。
そうか、CJK互換文字の利用は「推奨しない」と仕様書に明記されているんだね。覚えておこう。
330:デフォルトの名無しさん
18/05/28 16:00:24.98 OZmKBhwA.net
「完全なラウンドトリップ互換性の為に提供するものであり、それ以外の使用は推奨しない」
だから問答無用で“should not be used”と言ってる訳じゃないけどね。
331:デフォルトの名無しさん
18/05/28 22:09:23.88 .net
こまけえこたあいいんだよ
332:デフォルトの名無しさん
18/05/29 11:31:12.88 gAWLYOTz.net
>>319
お前、その省略酷くないか。わざとか?
ソースちゃんと確認せずに信じる奴が悪いのか。
こうやってネット伝言ゲームでデマが広まるのか。
333:デフォルトの名無しさん
18/05/29 11:40:21.01 QKhV4oKb.net
伝聞デマの好例
334:デフォルトの名無しさん
18/05/29 18:40:11.76 P35/pWO/.net
結局デマじゃないんでしょ?
335:デフォルトの名無しさん
18/05/29 22:34:44.54 j6aBPmpG.net
324は何を怒ってるんだ
319のフレーズは複数回出てきてその都度...の部分の
336:規格書名が変わるだけだろうに
337:デフォルトの名無しさん
18/05/30 12:07:23.64 iPjSEnXB.net
いやだからUnicode公式が推奨しないと言ってるのは事実なんだろ。デマじゃないじゃん。
なんでもかんでもデマ扱いすれば自分が偉くなったような錯覚になって気分が良いのかもしれないが
迷惑だよ、そういう態度は。
338:デフォルトの名無しさん
18/05/30 13:24:00.49 uOQbJF8C.net
>>328
CJK互換文字の使用が推奨されないのは事実だけど、ローマ数字が推奨されないのはデマってことなんじゃないの。
それと2行目以降は蛇足だろ。
339:デフォルトの名無しさん
18/05/30 14:33:31.86 glkZKJxk.net
復旧
🖕🏻🖕🏼🖕🏽🖕🏾🖕🏿🖕
340:デフォルトの名無しさん
18/05/30 20:29:52.46 +kRmOuNK.net
>>329
多分違う。
「CJK互換文字の一部には特定目的以外に使用すべきでない文字がある」が正しい。
318 はわざとか天然かは知らんが、CJK互換文字の一部にしか適用されないルールを、適用範囲の部分を抜かして引用して、あたかも全体に適用するルールであるかのように誤解する書き方をしてある。
あとは、それを鵜呑みした迂闊さんが「CJK互換文字は推奨されない(キリッ)」ってデマを広げる構図。
341:デフォルトの名無しさん
18/05/30 20:46:20.24 /bFYrAtR.net
だから「ラウンドトリップ用」って話だろ?
342:デフォルトの名無しさん
18/05/30 20:50:56.47 +kRmOuNK.net
>>331
タイプミス。318→319
343:デフォルトの名無しさん
18/05/30 20:55:57.87 +kRmOuNK.net
>>332
限定せずに「ラウンドトリップ用」って書いたらCJK互換文字全体だろ。
「JIS X 0213:2000のためのラウンドトリップ用」はその一部でしかない。
344:デフォルトの名無しさん
18/05/30 21:06:09.88 JjJ1rb8T.net
気に入らないなら自分で満足の行くように書き直して貼り付ければ?
典拠示されてるんだから。
345:デフォルトの名無しさん
18/05/31 00:48:48.00 Rt4SPplt.net
そんな中途半端に書き直して貼り付けるからデマの元になるんだろ。反省しろ。
346:デフォルトの名無しさん
18/05/31 05:31:03.12 fKyHNhNo.net
デマはどっちだよ……「CJK互換文字は」という文脈からは「CJK互換文字に含まれる全ての文字は」という意味しか受け取れないのだが?
「一部」なんていう表現はどっから湧き出てきたんだよ……。
347:デフォルトの名無しさん
18/05/31 09:53:50.67 Rt4SPplt.net
>>337
おまえはどこの「文脈」を読んだんだ?
とりあえず本物の規格読んでこい。
348:デフォルトの名無しさん
18/05/31 12:04:29.61 .net
ケチ付けるんなら他人を納得させられる論拠と出典を出せよ
それができないんなら『CJK互換文字の利用は「推奨しない」』が正解だ
349:デフォルトの名無しさん
18/05/31 15:11:25.68 LXR1oL3d.net
南京大虐殺は30万人アルニダ
350:デフォルトの名無しさん
18/05/31 20:31:47.82 fKyHNhNo.net
誰か結論下さい(他力本願)。
351:デフォルトの名無しさん
18/05/31 23:08:01.93 CO1u2co/.net
>>319のリンク先の規格書で、ラウンドトリップ用だから使用を推奨しないとされているのは以下の3種類だけ。
全体を非推奨とはしていないな。
・U+FA30~U+FA6A (JIS X 0213:2000)
・U+FA6B~U+FA6D (ARIB STD-B24)
・U+FA70~U+FAD9 (KPS 10721-2000)
352:デフォルトの名無しさん
18/06/01 05:30:12.89 vog2AnDp.net
誰が誰かよくわかんないけど少なくともCJK互換漢字の一部に関しては
非推奨の根拠はあったってことでしょ
不正確だと思ったならそうじゃなくてこうだって言えばそれで済んだ話だろうに
そうせずにネチネチ言うばっかだから無駄に荒れる
353:デフォルトの名無しさん
18/06/01 07:06:38.23 RdSMK5as.net
俺も>>320 >>321には違和感があったわ。
354:デフォルトの名無しさん
18/06/01 08:37:44.05 d/KZJvqH.net
>>343
一部でしかないのを全部のように言うから伝聞デマって言われたんだろ。
355:デフォルトの名無しさん
18/06/01 11:58:37.96 .net
>>342
一般の開発者やユーザーは「CJK互換文字の利用は推奨しない」で覚えておいた方が漏れがなくて安心だな
356:デフォルトの名無しさん
18/06/01 12:07:07.22 uCsHgk1n.net
規格書嫁とか無茶言うやつがいます。
あれは暗号で書いてあるので書いた人にも読めません。
357:デフォルトの名無しさん
18/06/01 12:41:04.24 gevSrdmF.net
あなたの能力の限界が人並み外れて低いからといって他人を同類扱いするのは良くない
358:デフォルトの名無しさん
18/06/01 14:43:43.87 s/+fnCQL.net
>>346
お前のような拡大解釈したいやつは「ユニコードの利用は推奨しない」で覚えておけば漏れがなくて完璧だな。
359:デフォルトの名無しさん
18/06/01 22:29:28.35 /Zhh/Hrk.net
>>346
CJK互換漢字 (CJK Compatibility Ideographs) : U+F900~U+FAFF と
CJK互換用文字 (CJK Compatibility) : U+3300~U+33FF は別物。
>>319で非推奨とされたのはCJK互換漢字(の一部)で、CJK互換文字ではない。
360:デフォルトの名無しさん
18/06/01 22:43:44.67 .net
>>349-350
こまけえこたあいいんだよ
逆に覚えたらどうするんだよ
「CJK互換」と付いてる領域は非推奨と覚えれば簡単だろ
361:デフォルトの名無しさん
18/06/01 23:15:14.57 /Zhh/Hrk.net
>>351
何のためにこんな専門スレにいるんだろうな
いっその事「文字コードの利用は推奨しない」で覚えておけば漏れがなく簡単だな
362:デフォルトの名無しさん
18/06/01 23:19:16.78 d/KZJvqH.net
既にデマは溢れてるので、今さら少しくらいデマが増えたところで、どうってことないという見方もあるが
規格の話をするなら細かい点を無視するとかありえない。
あえて >>350 にさらに細かい点をつっこむと
U+3300 - U+33FF は CJK互換ブロック(CJK Compatibility Block)
U+F900 - U+FAFF は CJK互換漢字ブロック(CJK Compatibility Ideograph Block)
とするのが正しいはずで「CJK互換文字」というのは表現は規格にはなかったと思う。
他にも
CJK Compatibility Forms (U+FE30 - UFE4F)
CJK Compatibility Ideograph Supplement (U+2F800 - U+2FA1D)
とかもあるので、勝手な名前とか使い始めるのはデマの元。
363:デフォルトの名無しさん
18/06/02 03:00:41.99 .net
弊社の開発プロジェクトでは「CJK互換」と名の付く文字は一律使用禁止とします
364:デフォルトの名無しさん
18/06/02 05:43:50.91 6Boi961X.net
Unicodeが公式に「利用を推奨しない」と明言しているのはCJK互換表意文字のそれも一部ってことはデマじゃないよね?
365:デフォルトの名無しさん
18/06/02 06:07:25.49 23A3G5JH.net
ここまでの議論読ませてもらったが
「利用を推奨しない」
と
「(他規格)との完全ラウンドトリップ互換を提供すためにユニコード規格に含まれている、それ以外の目的に使用すべきではない」
とだと規格上の意味が全然違う気がするんだが?
前者は利用の否定で、後者は利用目的の限定で利用は否定してない。
366:デフォルトの名無しさん
18/06/02 08:33:48.72 6Boi961X.net
>>356
「全然」ではなくね?
少なくとも「利用を推奨しない」は後者の意味も含んでるでしょ。完全に数学的な含有じゃないにせよ。
367:デフォルトの名無しさん
18/06/02 13:06:52.93 23A3G5JH.net
「これは食べられません」
と
「電子レンジ調理専用」
368:デフォルトの名無しさん
18/06/02 13:52:43.55 yUEJ+BJS.net
Scheduled maintenance on June 2 and June 9 between 5am pst and 6pm pst. Expect down times of up to 5 hours while we upgrade the power feeds in our data center.
5ちゃんねるサーバ群が収容されているデータセンタにおいて給電装置の更新のため閲覧書き込みが出来なくなります
予定されている期間は以下の通りです
2018年6月2日(土)21時から2018年6月3日(日)10時
2018年6月9日(土)21時から2018年6月3日(日)10時
上記時間帯のうち最大5時間程度の停電が発生
369:すると予想されています 不便をお掛けしますがよろしくお願い致します
370:
18/06/02 14:10:17.27 m4wz3xzo.net
>>359
?
>2018年6月9日(土)21時から2018年6月3日(日)10時
371:デフォルトの名無しさん
18/06/04 17:00:48.61 pTAw0294.net
>>342
マジか、マジだ
つまり最初に入ったKS X 1001/Big5/IBMは仕様書上では何も言われてなくて
後から入ったJIS X 0213とかは「ラウンドトリップ以外の使用は推奨しない」と明記なのか。
こんなことならJIS X 0213も無理してBMPに入れずにCNS 11643の残りと一緒にCJK統合漢字拡張Bに入れてもらえばよかったのに
(それが可能だったのかどうかは知らない)。
372:デフォルトの名無しさん
18/06/04 23:13:57.26 M5dk3jbS.net
後半、ちょっと違うんでは? JIS X 0213 の追加漢字は別に無理して BMP に入ってない。普通に Exntend の方に入ってる。
JIS X 0213 と Unicode の包摂基準の違いから1対多対応の部分があって、ラウンドトリップを保証したかったら互換文字が必要になった。
そして必要な互換漢字は少数で、たまたまBMPのCJK 互換漢字漢字ブロックの後半がガラ空きだったので、そこにつっこまれた。
って話だったと思う。
373:デフォルトの名無しさん
18/06/04 23:20:06.40 M5dk3jbS.net
規格がいってるのは CJK互換漢字ブロックはもともと複数の文字コードとのラウンドトリップ用なんだけど、
指定した一部の範囲は "JIS X 0213:2000" とのラウンドトリップ専用で、他の文字コードとのラウンドトリップにも使うべきではないということ。
374:デフォルトの名無しさん
18/06/06 14:26:39.66 R+kWiM6Z.net
Announcing The Unicode Standard, Version 11.0
URLリンク(blog.unicode.org)
375:デフォルトの名無しさん
18/06/07 22:48:02.08 YXHr2tyJ.net
Unicode 11.0出たのか、つかもう一年経ったのか……。
> Five urgently needed CJK unified ideographs: three for newly standardized names of chemical elements, and two for Japan's government administration Moji Joho Kiban Project that includes ideographs for personal and place names
へー、これは知らなかった。
376:デフォルトの名無しさん
18/06/07 23:56:45.77 LqY2ZR0d.net
一昨年末に名称が正式決定したニホニウム等の元素を表す漢字がUROの末尾に追加になったんだな。
377:デフォルトの名無しさん
18/06/08 00:10:00.49 .net
そんなもんで漢字増やすなや!
378:デフォルトの名無しさん
18/06/08 14:59:48.37 HNv18lZE.net
去年も書いたけど
Core Specification
Appendix D
Version History of the Standard
の漢字のとこの数字が足した数と合計で合わないんだよなぁ
48違うって何なんだろ。
379:デフォルトの名無しさん
18/06/08 23:58:07.79 ljSzk/l3.net
CJK統合漢字のUROの空きコードポイントは残り16個か。次でとうとうU+9FF0番台になる。
それらも全部使い切ったらその次の少数の緊急に必要な漢字追加は拡張A末尾の空きU+40B6~Fを使う事になるのかな。
でそこも使い切ったらBMPへの漢字追加は本当に終わりで拡張BやC、D…の末尾の空きを使用ってことになるんだろうな。
380:デフォルトの名無しさん
18/06/09 00:37:24.38 8sRiN6h8.net
文字列置換から除外するための一時退避の需要あるでしょ。
unicodeはプログラマが自由に使っていい領域ってどこだろう。
381:デフォルトの名無しさん
18/06/09 01:02:14.54 .net
「外字」でウィキれ
382:デフォルトの名無しさん
18/06/09 09:13:51.52 8sRiN6h8.net
>>371
回答ありがとう。
UnicodeのU+E000からU+E757あたりを使えばSJISにも対応できそう。
383:デフォルトの名無しさん
18/06/09 19:05:32.10 roRwdie6.net
curl 'URLリンク(www.unicode.org)' | wc -l
とやると
32292
と返ってきたんだけど、つまり今現在Unicodeには32292文字が収録されていると思っていいのかな。
384:デフォルトの名無しさん
18/06/10 06:07:59.44 gv3HXRco.net
何?結局16バイトに収まってたという話?
385:デフォルトの名無しさん
18/06/10 06:08:19.99 gv3HXRco.net
ビットだ……恥ずかしい
386:デフォルトの名無しさん
18/06/10 15:33:08.87 mkooDB8i.net
>>373
中身を見ればわかるけど漢字領域 (4e00 から 9efe) とかは
飛ばしてあるから全然違う。
387:デフォルトの名無しさん
18/06/10 16:00:53.49 aEB47NCz.net
Android P Beta 2、グリーンサラダの絵文字からゆで卵が消える | スラド デベロッパー
URLリンク(developers.srad.jp)
ゆで卵を入れる多様性は許されないのか
388:デフォルトの名無しさん
18/06/11 13:52:38.76 HvQh9O78.net
ジェンダーの方もなんか過剰だよね。政治的な活動家でもいるのかね
サラダの絵文字からGoogle、「卵」を排除 生産者団体が異議、「卵を返せ」論争に
URLリンク(www.j-cast.com)
389:デフォルトの名無しさん
18/06/11 16:02:07.37 yunMmu3l.net
なんか力抜けたわw
390:373
18/06/12 21:57:09.59 ZlrY5GZ7.net
>>376
収録されている全文字を取得するにはどうしたらいいかな…
391:デフォルトの名無しさん
18/06/13 00:45:51.71 .net
どうなってんのこれ🤔
🌕🌔🌕🌕🌕🌕🌕🌕
🌕🌒🌕🌕🌕🌕🌕🌕
🌖🌓🌕🌕🌔🌕🌕🌕
🌖🌒🌕🌗🌑🌔🌕🌕
🌖🌑🌔🌘🌒🌕🌕🌕
🌕🌘🌑🌑🌑🌑🌒🌕
🌕🌕🌘🌑🌑🌑🌑🌒
🌕🌕🌖🌑🌑🌒🌗🌓
🌕🌕🌕🌘🌑🌑🌘🌔
🌕🌕🌖🌑🌑🌑🌘🌔
🌕🌕🌗🌑🌑🌑🌖🌔
🌕🌕🌕🌘🌑🌑🌕🌔
🌕🌕🌕🌗🌒🌘🌔🌕
🌕🌕🌕🌗🌒🌖🌒🌕
🌕🌕🌕🌗🌓🌕🌒🌕
392:デフォルトの名無しさん
18/06/13 00:55:38.87 ixGTG5kv.net
5ちゃんでemojiのAAは文字数制限が厳しいからどうしても小さくなりがちだな
393:デフォルトの名無しさん
18/06/13 06:58:34.14 mbRQ9skB.net
なにか問題でも?
🧙🧚🧛🧜🧝🧟
🧙🏻🧚🏻🧛🏻🧜🏻🧝🏻🧟🏻
🧙🏼🧚🏼🧛🏼🧜🏼🧝🏼🧟🏼
🧙🏽🧚🏽🧛🏽🧜🏽🧝🏽🧟🏽
🧙🏾🧚🏾🧛🏾🧜🏾🧝🏾🧟🏾
🧙🏿🧚🏿🧛🏿🧜🏿🧝🏿🧟🏿
394:デフォルトの名無しさん
18/06/17 09:04:29.91 89kw/R7U.net
ユニコードとUTF8は何が違うんでしょうか
どちらもユニコード?それとも別のコード?頭がおかしくなりそうです
SJISだけで全て丸く収まっていた平和な日本にとんだ黒船がやってきた・・・
395:デフォルトの名無しさん
18/06/17 09:50:58.25 GftzeAnS.net
アップル外字どうなの
396:デフォルトの名無しさん
18/06/17 12:32:46.14 IMOrQ/Bc.net
>>384
文字集合と文字符号の違いならわかる?
397:デフォルトの名無しさん
18/06/17 12:38:22.96 .net
>>384
まずはウィキってこい
その上で分からないことがあれば質問しろ
398:デフォルトの名無しさん
18/06/17 12:51:10.01 usQhZnOB.net
Shift_JISだって文字集合違ったりベンダ固有拡張あったりで
全然丸く収まってないよ殴り合いだよ
399:デフォルトの名無しさん
18/06/17 13:31:33.71 wUKxAbyR.net
MSのgithub買収でVSからclone出来ないリポジトリが増えて
SJIS消えてくれたらいいのに
っていうかwindowsの標準localeでUTF-8選びたいんだが
chcp65001はもういやバグだらけ
400:デフォルトの名無しさん
18/06/17 13:54:11.58 bLV6Y
401:df8.net
402:デフォルトの名無しさん
18/06/18 01:32:33.22 44rsiuEs.net
linux つかってる俺はUTF8統一で隙はなかった。
そういえばGO言語ってソースコードはUTF8で書けって仕様で規定されてるんだな。(変な文字変数名に使えてビビった)
403:デフォルトの名無しさん
18/06/18 15:52:30.27 54OwzSMe.net
sjisはまだ許せる。utf16てめーはダメだ
内部コードに留めてメモリから外に出てこないでくれ
404:デフォルトの名無しさん
18/06/18 16:14:38.61 q6319o4n.net
std::wstringがデフォルトでUTF-32になるLinux 64bit版のSTLにも同じこと言えんの?
405:デフォルトの名無しさん
18/06/18 16:17:38.73 HrWV3yi6.net
SJISは完全に廃用でおk
406:デフォルトの名無しさん
18/06/18 16:32:51.52 UtQrM811.net
ほんそれ
407:デフォルトの名無しさん
18/06/18 17:04:46.60 EvkbZGBx.net
char32_tのある今、wchar_tの存在価値なんて無いでしょ
環境依存する上にWindowsではUTF-16ということで1要素1文字の前提も崩れてるし
408:デフォルトの名無しさん
18/06/18 20:41:12.57 44rsiuEs.net
誰に賛成して、誰に反対しているかわからん。安価つけろ。
409:デフォルトの名無しさん
18/06/19 07:29:13.13 DGMT9Nzy.net
?
410:デフォルトの名無しさん
18/06/19 23:25:00.68 3zIXQUO/.net
A社やG社始めメジャーなクラウド系サービスは全部UTF-8だな
411:デフォルトの名無しさん
18/06/20 01:39:40.00 xDrhFFX5.net
でも客にはSJIS対応を求められる不思議
412:デフォルトの名無しさん
18/06/20 01:55:53.31 9U83APqd.net
意味がわからないよな
SJIS神話は何なのだろう
ジジイだけでなく中年や、中には学生にまであるよねww
学生なんて生まれたときからUTF-8の環境にいるはずで、
わざわざ使いにくい環境をどこで覚えてくるんだろうと怖くもあるww
413:デフォルトの名無しさん
18/06/20 02:06:06.18 xDrhFFX5.net
日本語が2バイトで済む安心感じゃないの?
あと、最近の根拠もなく他国をおとしめて喜んでいる類の人達には、
日本専用のコード体系かっけーさすが日本すげーとか思ってそう。
414:デフォルトの名無しさん
18/06/20 06:24:00.33 ZRnpXX67.net
>>402
日本のビジネスデータは全銀フォーマット等のような固定長が基本だから
文字のバイト数が可変のUTF8は向かないんだよね
うちのシステムでも、相手がUTF8で作ったテキストを送りつけてきて
大事故になったことがあった
415:デフォルトの名無しさん
18/06/20 08:03:37.13 Va19lMsb.net
日本はまだマシで英語しか知らない欧米の連中だと「文字は1バイト」が常識だから
多言語化してても日本語を表示すると半分しか表示されないとかザラ。
最近はライブラリの整備や(通常全角幅の)絵文字の浸透のおかげで欧米の保守層にも文字コードの概念が伝わってるけどね。
416:デフォルトの名無しさん
18/06/20 08:52:51.05 OmEBDQrT.net
絵文字どころか10年以上前流行ったような古い日本の全角顔文字発掘してきて使ったりしてるよな最近
417:デフォルトの名無しさん
18/06/20 15:17:43.40 OnxnZInx.net
>>401
ほんそれ
418:デフォルトの名無しさん
18/06/20 15:19:01.43 OnxnZInx.net
>>403
なるほど
だとするとEBCDIC対応を求められても不思議じゃないな
419:デフォルトの名無しさん
18/06/20 17:02:56.44 AAtEE73s.net
utf-8で何も考えずにソートしたら漢字の並びが非直感的になるから
しぶしぶsjis
420:デフォルトの名無しさん
18/06/20 19:18:14.29 d5aRGVoI.net
>>404
想像で言ってるだろ
421:デフォルトの名無しさん
18/06/20 19:25:53.85 /OAGN
422:KMT.net
423:デフォルトの名無しさん
18/06/20 19:50:25.18 FyXniq7l.net
ほんそれ。
Windows使ってりゃSJIS要求するのは普通だし、そのWindowsはレガシーとしてSJISを捨てられないだけだし。
神話とか日本専用コードとかw
424:デフォルトの名無しさん
18/06/20 20:58:05.50 Va19lMsb.net
Windowsの文字コード周りで唯一好きなのは改行コードが\r\nである点。
他の環境ではLFだけという実際に即していないコードだから嫌。
LFなら普通は「桁位置はそのままで次の行に」でしょ……
abc\n
de
↑こうなるべき。
425:デフォルトの名無しさん
18/06/20 21:28:20.83 FyXniq7l.net
Windowsは互換性のためしょうがない部分はあるが、そういうのは\e[でやってろって感じだな。
426:デフォルトの名無しさん
18/06/21 01:11:25.06 M+oxnni+.net
>>412
改行コードなんだから当たり前だろ。寝ぼけんな。
CR は改行コードじゃなくて復帰コードな。ラインプリンターに出してるわけじゃないので復帰コードが必要かどうかは仕様依存。
427:デフォルトの名無しさん
18/06/21 01:29:39.14 9yZQgWTf.net
ラインプリンター由来じゃなくてタイプライター由来じゃないの
キャリッジリターン
ラインフィード
428:デフォルトの名無しさん
18/06/21 01:34:17.28 M+oxnni+.net
>>415
タイプライターに文字コードは必要ない。
正確にはテレタイプ端末とかテレプリンターとか呼ばれてた奴なんだが、要はラインプリンターだ。
429:デフォルトの名無しさん
18/06/21 01:45:44.30 9yZQgWTf.net
じゃあラインプリンターにもキャリッジあるの?
URLリンク(www.e-bridge.jp)
430:デフォルトの名無しさん
18/06/21 02:17:29.23 vn+zRuHD.net
ラインまるごと打つからラインプリンターなんだよねw
431:デフォルトの名無しさん
18/06/21 09:07:52.61 y5k3a+mj.net
MACみたいにCRだけっていうのは病気だけど
CR+LFが来たら常にCR無視しておけばいいし
自分で出力するときはLFだけ出力しておけばいい
それだけ
432:デフォルトの名無しさん
18/06/21 09:41:35.70 CR9+5isI.net
Why is the line terminator CR+LF?
URLリンク(blogs.msdn.microsoft.com)
If you go to the various internet protocol documents, such as RFC 0821 (SMTP), RFC 1939 (POP), RFC 2060 (IMAP), or RFC 2616 (HTTP),
you'll see that they all specify CR+LF as the line termination sequence.
So the the real question is not "Why do CP/M, MS-DOS, and Win32 use CR+LF as the line terminator?"
but rather "Why did other people choose to differ from these standards documents and use some other line terminator?"
433:デフォルトの名無しさん
18/06/22 13:23:16.23 zvOmzJZB.net
そのブログは CR + LF を正当化してるけど、テキストファイルの改行は
単に行のデリミタであって、カーソルの移動を意味してるわけじゃないと思うんだよね
434:デフォルトの名無しさん
18/06/22 15:59:28.46 MYEvMa8B.net
International Business Machines
435:デフォルトの名無しさん
18/06/22 21:46:22.33 Lyh+6zOM.net
HAL 9000
"I'm sorry, Dave, I'm afraid I can't do that."
436:デフォルトの名無しさん
18/06/26 16:07:00.46 Jp9iFqVj.net
>>421
だよな。テレタイプじゃないんだから10か13をLE(Line End)にすればいいんだ
437:デフォルトの名無しさん
18/06/26 22:23:33.42 PAZ2qH9Y.net
一方でEBCDICはCRやLFとは別にNLを定義した。
438:デフォルトの名無しさん
18/06/27 00:01:18.11 4lF2I/sY.net
コレが正解
URLリンク(i.stack.imgur.com)
つまり
carriage returnは行頭に復帰
line feedは行送り
CRだけなら何度も同じ行が上書きされる(行送りされない)
LFだけなら例えば3行だとこうなる
XXXXXXXX
XXXXXXXX
XXXXXXXX
439:デフォルトの名無しさん
18/06/27 00:23:59.29 Xb4utxw7.net
⮠じゃなくて⮦
440:デフォルトの名無しさん
18/06/27 00:37:35.67 BTQKl7xc.net
>>426
何自慢げに周回遅れなこと書いてんだ?
それ前提の議論だぞ?
>>417見ろや
441:デフォルトの名無しさん
18/06/27 00:53:00.34 4lF2I/sY.net
そんなこといいだしたら
デリミタなんかなんでもいいことになる
ただの文字コードの羅列だからな
CRである必要もないしLFである必要もない
そもそもキミラはアホなこといってるワケ
項目のデリミタにカンマつかったり水平タブ使ったりする
行のデリミタだってなんでもいい
バカはホント困るわぁ
442:デフォルトの名無しさん
18/06/27 02:30:43.48 ulOW8GiO.net
>>429
だから決めだけの問題だから何でもいい。
ASCIIという文字コードの規約の問題。
実際にEBCDICは CR でも LF でもない制御コードを別途改行コードとして用意した。
ASCII については規格の策定時から LF を押す国際派(ISO)と CR+LF を押す国内派(ANS)が対立していて一意に決まってない。
443:デフォルトの名無しさん
18/06/27 09:37:29.05 5XsMHgY7.net
もともとテレタイプ前提の文字コードだからなあ
444:デフォルトの名無しさん
18/06/27 15:41:13.36 2dfKv2YD.net
文字の話しろ
445:デフォルトの名無しさん
18/06/27 15:48:44.41 EKUkk/oX.net
いや文字コードの話するスレだろ
446:デフォルトの名無しさん
18/06/27 18:10:34.52 rSBeNI25.net
CR/LFは文字じゃないのか……(驚愕)
447:デフォルトの名無しさん
18/06/27 21:08:46.77 ulOW8GiO.net
制御コードであって文字ではないな。
少なくともASCIIとUnicodeでは。
448:デフォルトの名無しさん
18/06/27 22:13:49.89 5OUSIXAr.net
制御文字のコードです
449:デフォルトの名無しさん
18/06/27 22:58:53.48 +kEwaWuV.net
>>420
その後に書いてある「I'm told that the ASCII committee changed the name of character 0x0A to "newline" around 1996, so the confusion level has been raised even higher.」
ってどういうことなんだろう?
ASCII委員会が1996年頃に0x0Aの名前をnewlineに変更して混乱が深まった?
ASCIIって1986年が最終改訂じゃないの?
450:デフォルトの名無しさん
18/06/28 09:21:41.88 iSaREpik.net
コンピュータの出力装置がゴルフボールの電動タイプライターだった時代、
例えば「アンダーライン入りの文字」を打つ時は、普通に文字を打って、
「ラインフィードの無いキャリッジリターン」をやって、
アンダーラインだけを打っていたのだと思う。
すると、キャリッジリターンには、ラインフィードが付く場合と付かない
場合があり、両者は明確に区別できなければならないはず。
ASCIIコードが制定された時代から考えると、改行コードが「CR/LF」
になったのは、そうゆう趣旨かな?と思う。
451:デフォルトの名無しさん
18/06/28 09:47:22.60 /fqEtI/z.net
>>438
キャリッジリターンは行頭に戻るだぞ
キャリッジリターンだと行頭の文字しかアンダーラインを打てないのでは?
バックスペースで1文字分戻ってアンダーラインを打ったり
文字を二度打ちして太字にしたりしてたと聞いたぞ
452:デフォルトの名無しさん
18/06/28 11:06:58.11 5Es+lqIV.net
BOMとかUTF-8Nってなんですか?
453:デフォルトの名無しさん
18/06/28 12:37:34.87 iSaREpik.net
>>439
なるほど。ありがとう。 <
454:デフォルトの名無しさん
18/06/28 12:46:09.81 4/XCwkvc.net
unicodeになって重ね打ち的な概念復活してきてね?
455:デフォルトの名無しさん
18/06/28 15:12:27.72 LwHbkD+y.net
>>439
重ね打ちをしたくないところはスペースを使えばいい
>コンピュータの出力装置がゴルフボールの電動タイプライターだった時代
スペースは何も印字せずに印字位置を一文字分進めるのであって
その位置の文字を空白で置き換えたり
その位置に空白を挿入するのではなかったのだから
昔読んだ本に、重ね打ちのためにバックスペースを使っている文書を
バックスペースを使えないプリンターでも重ね打ちできるように
変換するプログラムが載っていた
詳細は忘れたけど、CRとスペースを使うのだったと思う
>>438
それだと行頭に戻る機能だけをCRとして用意する理由にはなっても
行頭に戻る機能をLFに持たせない理由にはならないのではないか?
行頭に戻さずに行だけ変えることに当時は意味があったのかも知れないけど思いつかない
456:デフォルトの名無しさん
18/06/28 16:20:32.60 FdbC2U6h.net
escシーケンスでも改行せずに行頭に戻したり出来たからな
457:デフォルトの名無しさん
18/06/28 16:21:52.50 FdbC2U6h.net
>当時は意味があったのかも知れないけど
紙の排出に使われてたぞ
458:デフォルトの名無しさん
18/06/28 18:55:39.46 wMlREDKw.net
>>443
コレクションタイプに全字画印字のキーってなかったっけ?
まさに"空白"を打てるやつ。
459:デフォルトの名無しさん
18/06/28 23:48:15.68 d1dmwFto.net
UTF-8Nというのは
だれかがテキトーにつけたUnicodeのエンコードの名前
先に結論をいうとUTF-8NはBOMついてないUTF-8ということらしいからな
さらいえばUTF-8にBOMつける意味はほとんどない
とりあえず概要だけ書いといてやろう
BOMというのは、符号単位のオクテットの並びが
リトルエディアンかビッグエンディアンか識別するためにファイルの先頭にマークされる
ちなみにそれぞれのエンコードの符号単位はこんな感じなる
UTF-8:1つのオクテット
UTF-16:2つのオクテット
UTF-32:4つのオクテット
つまり、UTF-8ではそんなマークつけても意味がない
オクテットが1つしかないからな、並びなんか関係ない
2つ以上の場合、オクテットの順序がリトルエディアンかビッグエンディアンかで
数値の表現のされかたが変わる
CISC系のチップだと数値の表現はリトルエンディアンが多い
RISC系のチップだと数値の表現はビッグエンディアンが多い
つまり、CISC系のチップでリトルエディアンで保存されたファイルなら
エンディアンを気にせずにファイルに保存された数値をそのまま読むことができる
しかしビッグエンディアンなら一旦オクテットの並びを逆転させてから
数値を読みとる必要がある
RISC系のチップならその逆になる
分かった?
460:デフォルトの名無しさん
18/06/29 03:04:36.82 8Q0GtZXS.net
わかんない。
なんで他のシステムで読む可能性のあるファイルなのに
フォーマットを決めないの?
461:デフォルトの名無しさん
18/06/29 09:04:53.35 iuHQPsKC.net
>>443
> 行頭に戻さずに行だけ変えることに当時は意味があったのかも知れないけど思いつかない
例えば、ゴルフボールで次のようにタイプすることを考えてみる。(□はスペース)
□□□□□□□AA
□□□□□□□AA
□□□□□□□AA「CRの無いLF」「BS」「BS」AA
と打つと、行頭に戻すよりも速く打てると思うが。
462:デフォルトの名無しさん
18/06/29 09:11:34.75 pXG1OaDl.net
CISC RISC って今は無意味だしエンディアンとは関係ない
関係あると思うのは知ってるCPUが少ないだけかと
あと上で重ね打ちが昔の話みたいに言ってるけど
man使ったことないの?
端末によるけどたいていアンダーラインがつくよ
463:デフォルトの名無しさん
18/06/29 09:17:15.33 pXG1OaDl.net
>>443
CRとLFに分かれてるのは当時のハードウエアがそういう仕様だったから
画面制御のコンテキストで意味を求めてもしょうがない
464:デフォルトの名無しさん
18/06/29 11:08:54.85 95WXFXv0.net
BOMの有無でCSVをexcelに読ませる際に文字化けするんだよね
465:デフォルトの名無しさん
18/06/29 11:50:23.53 Uc21CWyX.net
そういう仕様だったから、ってのは何の考察にもなってない。
人類が争いをやめないのはそういう仕様になってるから。
466:デフォルトの名無しさん
18/06/29 15:14:45.43 C6H9lGIq.net
>>450
>(manでは)端末によるけどたいていアンダーラインがつくよ
manでアンダーラインがつかないと言っている人はいないし、昔は
>バックスペースで1文字分戻ってアンダーラインを打ったり
>文字を二度打ちして太字にしたりしてた
というのとは別の話だろ
467:デフォルトの名無しさん
18/06/29 15:35:26.60 C6H9lGIq.net
>>453
そうなっていたのはなぜかという話をしているのに
「そうなっていたから」と返されてもな…
468:デフォルトの名無しさん
18/06/29 16:16:27.86 kXqQNYVA.net
>>449
速く打てるだろうけど、そういうことをやりたい状況ってどれぐらいあるんだろ
行頭へ戻すほうがずっと多いだろうし、その場合にCR LFと打つことに
なってもしかたないと思えるほど>>449の状況は多かったのだろうか
キーを一つ押せばCR LFと出るように設定できれば手間はかからずにすむけど
設定できたとしても改行に2文字使うのは変わらない
昔は記録用に紙テープを使っていたようで、行毎に1文字多く使うと
その分、紙テープの消費は多くなる
そうなってもしかたないと思えるほど>>449の状況は多かったのだろうか
469:デフォルトの名無しさん
18/06/29 22:19:47.60 jsqIPRMd.net
ちょっと関係ないがGoogle翻訳では改行は%0Aだね。
HTTP関連の改行コードはCRLFが多いと思うんだけど,珍しい。
470:デフォルトの名無しさん
18/06/29 22:36:32.85 8Q0GtZXS.net
そこはhttp関係ないじゃん
471:デフォルトの名無しさん
18/06/29 23:08:44.45 sSTEuPuw.net
むしろフォーマットがきまってる
リトルエンディアンの形式でもいいし
ビッグエンディアンの形式でもいいというフォーマットだからな
構成システムがリトルエンディアンの計算機が多い場合、リトルエンディアンで扱う方が有利
当然、構成システムがビッグエンディアンの計算機が多い場合、ビッグエンディアンで扱う方が有利になる
後処理の計算機のリソース消費量を減らすために先にいちいち毎回エンディアン変換するのもムダだしな
ちなみにネットワークのプロトコルの標準では歴史的な事情があって
ほぼ暗黙でビッグエンディアンになってる
ドキュメントにエンディアンが記載されてなければ
ビッグエンディアンとみなしてほぼ問題ない
472:デフォルトの名無しさん
18/06/29 23:10:02.53 sSTEuPuw.net
ちなみにキミラみたいな貧乏人が使ってるPCは
ほとんどリトルエンディアンになる
473:デフォルトの名無しさん
18/06/30 00:16:14.33 I+9paw5R.net
やっぱり今時半角カタカナ使う人にはアレな人が多いのか
474:デフォルトの名無しさん
18/06/30 01:04:57.77 2NGdD93t.net
>>459
どっちでもいい=決まってないだろ
頭悪いと半角カタカナが大好きになるのはなんでだぜ?
475:デフォルトの名無しさん
18/06/30 03:46:45.67 O2H7A6pY.net
>>460
じゃあお前何使ってんだ?
貧乏人なのでスマフォ叩きながら質問。
476:デフォルトの名無しさん
18/06/30 04:38:43.11 8S9cJyih.net
やっぱりユニコードが諸悪の根源
あれが入って来てからコンピュータが扱いづらくなった
日本はSJISに統一しよう
477:デフォルトの名無しさん
18/06/30 06:04:05.89 tYfB6W3t.net
Unicode程度でコンピューターを扱いずらくなる脳味噌って……同情するわ。
478:デフォルトの名無しさん
18/06/30 13:06:02.67 QAvD/WKt.net
エンディアン関係ないUTF-8が一番良いな
479:デフォルトの名無しさん
18/06/30 13:32:27.92 cCXC0XvW.net
UTF-8 はバイト列を見て文字がわかりにくいのが難点
480:デフォルトの名無しさん
18/06/30 13:49:23.03 O2H7A6pY.net
>>467
なんで?
481:
18/06/30 14:05:18.42 BPi0VHAg.net
>>464
最初から 32 ビットにしなかったのが問題でしたね
482:デフォルトの名無しさん
18/06/30 18:58:11.39 cCXC0XvW.net
>>468
うーん、いやあ、あらためて考えると単に分かりづらいと思い込んでる
だけだったかも。JISX0208 の文字って3バイトになるでしょ。
あの 3バイトずつになるのがどうも慣れないだけだった。467 は撤回するよ
483:デフォルトの名無しさん
18/06/30 20:27:41.69 ozTCpxdq.net
BOMでエンディアンが規定できるからな
そのようにフォーマットできまってる
数値の読みとりかたも一意に定まる
どっちでもいいというワケではない
バカはホント困るわぁ
つまり
リトルエンディアンで2つ以上のオクテットがあるのに
先頭にBOM入れないヤツはゴミクズといえる
Javaのバイトコードに CAFE BABE が入ってないぐらいお話にならない
ビッグエンディアンならBOMなくてもオレはよいとしようと考える
484:デフォルトの名無しさん
18/06/30 22:43:16.16 2NGdD93t.net
半角カタカナは目に入ってこないなw
485:デフォルトの名無しさん
18/06/30 23:05:58.78 8S9cJyih.net
恐ろしいのは、PCを使う一般人はユニコードとかBOMとか全く知らないこと
IT技術とIT利用者のレベルのギャップがいつかデカい事件を起こすだろう
PC社会は薄氷の上を歩くような危うさの中に成り立っている
486:デフォルトの名無しさん
18/06/30 23:20:50.17 0vzJToCT.net
未だに半角とか全角を使用者に意識させるのが残念でならない
カタカナなんて文字としては一種類なんだから機械的に変換してしまうのが当たり前になって良さそうなのに
487:デフォルトの名無しさん
18/07/01 15:37:44.32 ep584YMH.net
2ちゃんがSJISオンリーってのがそもそもはよなおせ
488:デフォルトの名無しさん
18/07/01 15:50:52.13 3SrV2o5x.net
sjisオンリー❓🤔
489:デフォルトの名無しさん
18/07/01 16:00:26.27 omYv90Gk.net
>>470
中国のGB 18030みたく1バイト/2バイト(EUC-CN)の上に4バイトを重ねる方法もあるけど
それならUTF-8の方がすっきりしてていいわな
490:デフォルトの名無しさん
18/07/01 18:18:14.73 EnuoS7Gy.net
Unicodeのクソなところは、既存のコード体系を無視してるところだよな。
まさに欧米人のやり口そのもの。
491:デフォルトの名無しさん
18/07/02 03:00:52.60 EL6wSxah.net
たとえば?
492:デフォルトの名無しさん
18/07/02 08:27:03.72 FZsTYqY7.net
Shift-JISが発音区別符号のついたラテン文字などをサポートしていればよかったのに。
493:デフォルトの名無しさん
18/07/03 09:01:30.75 IDUMbXdY.net
>>478
jis やsjisとかと全く関係なく決められている事を言ってるのだと思うが、
それは中国の横やりだよ。
欧米人からすると、CJKのコードなんて、どうでもいいわけで。
494:デフォルトの名無しさん
18/07/03 14:32:34.20 R6pmKHtn.net
>>464
文字列末尾からの逆方向検索を実装してごらんなさい。
もれなく SJIS に対する殺意が目覚めますよ。
495:デフォルトの名無しさん
18/07/03 14:34:40.85 gQF2QJmD.net
SJISは廃用で
496:デフォルトの名無しさん
18/07/03 14:55:13.29 pQbF/VH/.net
はいよっ!
497:デフォルトの名無しさん
18/07/04 03:13:37.83 FxllvN6o.net
>>482
ビット立てながら先頭から見ればいいだけじゃん?
498:デフォルトの名無しさん
18/07/04 17:14:03.55 LFQ4ypq9.net
うーん
499:デフォルトの名無しさん
18/07/04 21:57:50.06 gFgZc5FG.net
KZD
500:デフォルトの名無しさん
18/07/04 23:49:15.94 s7W39adb.net
昔、Unicodeもない時代に全文検索エンジン作ったことがあるが
インデックス作るのにもマッチング用に符号圧縮したデータ作るのにも
設計がめんどいわ処理時間がかかるわだろうから
Shift_JISデータから16bitのデータに一旦変換してからそういったデータを作成するようにしてたわ
要件が検索漏れゼロ、ノイズゼロ、なおかつメディアは超トロイCD-ROMという
ありえない滅茶苦茶な内容だったからな
インデクサは大富豪な設計でないとやってられなかった
インデックス作成にリアルタイム性が要求されなかったからまだ救いがあったともいえる
その全文検索エンジンはインデックスを大
501:きくすればするほどインデックスが大きくなるかわりに 最悪のケースの速度が速くなるという仕様にした(最低限必要な性能の要求水準に応えるため) インデックスを大きくするということはインデックスを作るのに当然時間がかかるということになる いまはそれもとてつもなくデータが増えてDVDになってる インデックスもものすごい大きくなってる で、その最悪のケースというのは、 符号圧縮されたデータをマッチングする回数が増えることを意味する マッチングの条件はマッチングキーワードから生成するインデックスに含まれる符号圧縮された符号の組み合わせになる そのマッチングアルゴリズムにBMHを使うことになる
502:デフォルトの名無しさん
18/07/04 23:50:33.59 s7W39adb.net
で、このBMHというのは文字列マッチングで非常に有効なアルゴリズムといえる
しかしShift_JISでは使えない
ユニコードならそのまんま使える
順方向からの文字列マッチングですらShift_JISでは
こういった高速なマッチングアルゴリズムが使えない
いかにShift_JISがウンコかよくわかる典型的な例といっていい
503:デフォルトの名無しさん
18/07/05 01:32:31.02 Iw1yLrzA.net
>>488
> インデックスを大きくすればするほどインデックスが大きくなる
髪を長くすればするほどロングになる
504:デフォルトの名無しさん
18/07/05 01:51:36.04 T0L/NWDK.net
ただし抜けやすくなる
505:デフォルトの名無しさん
18/07/05 02:11:26.21 8UhFPcQc.net
半角カタカナを多用されるとCOBOLで作ったんじゃないかと思っちゃうね
506:デフォルトの名無しさん
18/07/05 02:30:50.16 HIyPet1B.net
大発見じゃん
507:デフォルトの名無しさん
18/07/05 18:37:34.34 0T2GdzcY.net
半角カナもそうだけど、全角英数も大概だよなぁ
経緯的なもんだろうけど、
未だに『住所はすべて全角で』みたいなWebフォーム有ったりするし
508:デフォルトの名無しさん
18/07/05 19:38:22.34 CqUNBSEq.net
Unicodeって日本を優遇しすぎてない? そう思うのは日本人の奢りなのかな。
例えば上で挙げられてる絵文字や全角英数、半角片仮名だって日本由来だし、
「CJK互換文字」と謳いつつ、キロメートルを一文字幅に短縮したやつとかも全部日本のJISコードとの互換性を保つために導入されてる訳じゃん。
そういうのってどうなのかなぁ。
自分は嬉しい(過去の、Shift-JISでエンコードされた文書が情報の欠損なく読めるから)んだけどね、もちろん。
509:デフォルトの名無しさん
18/07/05 20:37:53.33 cHUpj8OH.net
>>495
線文字Aとか楔形文字拡張とか見ても同じこと言えるか?
510:デフォルトの名無しさん
18/07/05 21:16:32.44 CqUNBSEq.net
>>496
でもあれは互換性もクソもないじゃん
511:デフォルトの名無しさん
18/07/05 22:49:22.73 cHUpj8OH.net
誰にも読めない、使えない、未解読の古代文字とか登録してるくらいだから、現代でも使用可能な文字なら余裕って話だ。
512:デフォルトの名無しさん
18/07/05 23:18:38.72 0kDXGIdf.net
だめか
𒀑
𒄦
くさび
513:デフォルトの名無しさん
18/07/06 07:29:45.69 3U2Ta28u.net
㍻(元号を一文字化したもの)とかあるからな
申請すれば何でも通るんじゃねーの
514:デフォルトの名無しさん
18/07/06 08:24:58.10 QJllJwz8.net
申請する権利のある人ならな。
大手OSメーカー、国家規格代表、ごく一部の文字専門家。
515:デフォルトの名無しさん
18/07/06 08:47:24.31 IGjSb2yt.net
㍼、㍻などは、昔の(日本の)文字コードとの互換性を取るために
残しているだけ。だから、次の元号の合わせ文字は通らない。
516:デフォルトの名無しさん
18/07/06 10:05:30.92 odzQpd8G.net
文部の沙汰も金私大
517:デフォルトの名無しさん
18/07/06 19:02:02.70 3U2Ta28u.net
>>502
もうコードの場所を確保してあるってMSの元号対応ブログで言ってたよ
518:デフォルトの名無しさん
18/07/06 22:30:52.61 p79Hvr/2.net
先月のWG2ロンドン会議で32ffが予約された
>>501
申請者に権利なんてないよ。英文ができてフォントが作れるなら誰でも提案できる
519:デフォルトの名無しさん
18/07/07 01:28:54.42 kLxolQc6.net
空いてるとこにテキトーにいれてるだけやん
文字コードが連続してないし
ひどいマッピングされてるわ
520:デフォルトの名無しさん
18/07/07 10:47:15.09 OQyJYPpl.net
元号は、これからもどんどん増えてゆくんだから、Unicodeに
「日本元号面」を作って、そこに入れるようにしてほしい。
521:デフォルトの名無しさん
18/07/07 11:50:18.74 kLxolQc6.net
ちなみに先に書いた全文検索エンジンでは
アイウエオもアイウエオも
ガギグゲゴもガギグゲゴも
12345も12345も
abcdeもabcdeも
同じ文字コードとして扱ってる
つまりどっちでキーワード書いても当たる
見た目(つまりグリフ)が違うだけで同じだからな
しかし明治大正昭和平成を㍾㍽㍼㍻までは
やってない
すでにいろんなもんでその全文検索エンジンは使われてるが
コレで文句がきたことはない
つまりだれも気にしてない
522:デフォルトの名無しさん
18/07/07 13:23:15.59 WVErtcKw.net
カ゚キ゚ク゚ケ゚コ゚はどうなるんだ
523:デフォルトの名無しさん
18/07/07 13:49:40.16 kLxolQc6.net
こんな感じの内容からインデックスやマッチング用のデータが作成される
ガギグゲゴ ガギグゲゴ ⇒ カ゛キ゛ク゛ケ゛コ゛
カ゚キ゚ク゚ケ゚コ゚ ⇒ カ゜キ゜ク゜ケ゜コ゜
つまりインデックスやマッチング用のデータを作る前に前処理で一気に痴漢することになる
で、キーワードをガギグゲゴやガギギゲゴやカ゛キ゛ク゛ケ゛コ゛にすると
カ゛キ゛ク゛ケ゛コ゛で検索することになる
つまりこの全文検索エンジンは濁音も半濁音も検索できる超優れものといえるのだ
524:デフォルトの名無しさん
18/07/07 14:06:53.21 IMiijYtR.net
痴漢アカン
525:デフォルトの名無しさん
18/07/07 14:25:13.00 WVErtcKw.net
俺はそういうのを考えるのが面倒だからUNICODE正規化だけしてる
おかげで平成と㍻もちゃんと検索でヒットする
526:デフォルトの名無しさん
18/07/07 15:16:01.20 kLxolQc6.net
ちなみに客ごとに置換辞書を作ってる
客ごとに要望が違うからな
客によってはいろんな要望をいってくる客もいる
その要望に応えるのも仕事だからな
で、そのなかに㍾㍽㍼㍻を置換した例はない
全角にマッピングされてるasciiや半角カナの部分は
コレについてほぼ間違いなくみな同じ結論になる
それ以外で異なる特殊な部分は結構ある
文字コードでシノニムの部分もあれば、それ以外でシノニムにしたい部分もあったりする
それは客の業務に依存する部分になるからな
527:デフォルトの名無しさん
18/07/07 15:17:11.21 kLxolQc6.net
考えるのはキミじゃないワケ
キミはただのドカタなワケ
わかる?
客と良好な関係を保つには
できるだけ、それは仕様ですは避けないといけない
そしてそれを低いコストで実現できないといけない
なにをしたいのかはっきりといってる部分については
こっちから客の業務についてどうこういう必要も理由もないし
こんなしょうもないことを実現するためにめっちゃカネかかりますよとかいえるワケもない
そういうことだ
528:デフォルトの名無しさん
18/07/07 15:56:51.92 hSg2x2AH.net
>>507
次の次の次に予定されてる人が、女性に興味が持てない人だったり、
ジジイババアに囲まれて育つからババア専に育ったりするかもしれないぞ?
529:デフォルトの名無しさん
18/07/07 17:04:10.09 i11AJyJz.net
絵文字の無茶な合成が有りなんだから
平と成をzwjでくっつけたら㍻になるとかでいいのに
530:デフォルトの名無しさん
18/07/07 20:17:18.16 Ty8z3s6n.net
魚 + ZWJ + 里 = 鯉
とか収拾がつかなくなる
531:デフォルトの名無しさん
18/07/07 20:47:01.42 hSg2x2AH.net
光+宙=ピカチュウとか?
532:デフォルトの名無しさん
18/07/07 21:11:
533:51.93 ID:URcWOMtI.net
534:デフォルトの名無しさん
18/07/07 22:51:54.27 AwQTnpwn.net
月+光=胱とか
実際に胱を人名に使えるようにしてほしいという要望があるそうだ
535:デフォルトの名無しさん
18/07/08 00:07:58.74 ib3y3idC.net
自力でマッピングするnkfの遅さ。文化遺産だから保守され続けるのだろうけど。
536:デフォルトの名無しさん
18/07/08 00:46:47.26 5rg7g6N2.net
ていうか確かそういう(漢字を結合する)のにピッタシな文字が用意されてた筈。
漢字表示文字だとかいう名称だったけど、検索してもそれらしい記事が引っ掛からんので
多分この名称は違う。
537:デフォルトの名無しさん
18/07/08 00:54:45.54 AL4TGRyQ.net
>>516
日本NBがBMPに専用のコードポイントを確保することにこだわった
BMPしか扱えず合成何それ?みたいなシステムが国内にいっぱい残ってるんだと
538:デフォルトの名無しさん
18/07/08 21:30:52.45 Dz8m9jRj.net
>>520
でもその月は本来は肉なのでわ
539:デフォルトの名無しさん
18/07/08 21:58:14.68 VztP7D+N.net
>>524
キラキラネームつけるレベルの頭の人だよ?
そんな難しいことわかんないよ。
540:デフォルトの名無しさん
18/07/08 22:00:52.97 fj164SAR.net
>>520
要望する人はそんなの気にしないんでしょ
541:デフォルトの名無しさん
18/07/08 22:01:58.98 fj164SAR.net
>>526
アンカ間違えた
>>524
要望する人はそんなの気にしないんでしょ
542:デフォルトの名無しさん
18/07/08 22:15:50.43 0enAxBm5.net
合字と、ひとつの漢字が偏旁に分かれているのとはまた別だろ
543:デフォルトの名無しさん
18/07/08 22:25:52.71 fj164SAR.net
胱を人名に使えるようにしてほしいと要望している人たちは
胱を月と光の合字のようなものと考えてるんだろうなって話だからな
544:デフォルトの名無しさん
18/07/08 22:58:07.18 CFOYAJun.net
しかし肉と光でなんで膀胱なんだろうな
光は頭の上に火を掲げる神聖な存在を表していたらしいけど
特殊な性癖の人が尿を聖水というのと関係があるのかしら
545:デフォルトの名無しさん
18/07/08 23:05:05.80 FVlDE0YC.net
三光作戦の光
546:デフォルトの名無しさん
18/07/09 02:42:13.13 f4diYHew.net
形声文字という概念も知らんのか…
547:デフォルトの名無しさん
18/07/09 03:26:55.92 kfYRLcv/.net
>>530
URLリンク(blog.goo.ne.jp)
胱 コウ 月部にく
解字 「月(からだ)+光(ひろがる)」 の会意形声。身体の中で尿をためておく袋状のもの。尿がたまってくると袋がひろがる。
意味 「膀胱ボウコウ」(ゆばりぶくろ)に使われる字。旁ボウも光コウも、ひろがる意。これに肉月をつけて身体のなかで尿をためて拡がる器官を表した。
548:デフォルトの名無しさん
18/07/09 04:35:05.56 4WT+OSln.net
肺やちんこも広がるのですが?
549:デフォルトの名無しさん
18/07/11 19:19:37.68 gmqqN491.net
昔の知識じゃそんなこと分からんやろ
足りない頭ひねって考えろやボケナス
550:デフォルトの名無しさん
18/07/11 19:27:48.34 A6luu057.net
昔のちんこは拡がらなかったのですか!?
551:デフォルトの名無しさん
18/07/11 22:21:59.51 LQKpeeG0.net
大陸の人のちんこはやらかい印象がある
552:デフォルトの名無しさん
18/07/12 02:46:54.78 iPCGhCdE.net
ギリシャでは包茎が持て囃された
553:しね
554:デフォルトの名無しさん
18/07/12 09:58:56.70 x8Svnlzm.net
豚の膀胱が蹴鞠の材料だっけ
555:デフォルトの名無しさん
18/07/18 22:57:34.06 BB+kHIx9.net
新元号がUnicode12にギリ間に合わないから12.1出そうかって話が出てきたか
556:デフォルトの名無しさん
18/07/19 01:23:42.91 yQzT/5Dr.net
この前危うく間に合いそうになってましたけどね
557:デフォルトの名無しさん
18/07/19 06:57:15.79 0leqnnH4.net
えぇ そんな一国の事情でUnicode様が右往左往されるのですか!?
558:デフォルトの名無しさん
18/07/22 16:13:27.34 WQtj2cDH.net
トルコリラの「も」みたいなやつ追加した時もほぼそれだけじゃなかったっけ?
559:デフォルトの名無しさん
18/07/25 14:58:24.45 oBls1I2Q.net
Adobe-Japan1-6 Is Expecting!
URLリンク(blogs.adobe.com)
えーAdobe-Japan1-7って新元号を追加するだけで終わりなのー?
560:デフォルトの名無しさん
18/07/25 17:15:18.78 41CwtA3+.net
う、うん…(´・ω・`)
561:デフォルトの名無しさん
18/07/25 18:24:58.87 oBls1I2Q.net
JIS X 0212 補助漢字の残りはいつになったら……(´・ω・`)
562:デフォルトの名無しさん
18/07/25 19:23:56.34 rm2bmQuM.net
UTF-7の仕組みをはじめてしったが面倒くさいエンコードだった。
UTF-16と、BASE64に依存しててこれがなければ成立しないのかよ。
単体で存在するUTF-8とかと一緒かとおもってた。
563:デフォルトの名無しさん
18/07/25 22:28:09.49 NKwfwGfT.net
元号の組文字に先行リリースするほどの価値があるかなぁ
何にしろ早くAJ18出してよ
564:デフォルトの名無しさん
18/07/25 22:55:41.73 QC64Azkr.net
元号の組文字使ってるとこあんの?
565:デフォルトの名無しさん
18/07/26 00:34:28.84 a2xMjw11.net
来年の5月までまだ9ヶ月強あるのに今の時点でもうAJ1-7は2文字だけと決めてしまうなんて
候補の選定ってそんなに手間のかかるもんなのかねぇ
566:デフォルトの名無しさん
18/07/26 20:55:22.84 vMAtbXfy.net
どの言語圏であれ、国家が絡めば、Unicode界隈ではおおごとだよ。日本の元号だってまさにそう。
あの絵文字どうしますかね、とかそういうレベルじゃないから。
567:デフォルトの名無しさん
18/07/27 01:59:49.37 mPyMQHHw.net
元号も絵文字にしようよもう
覚えるの大変だよ
568:デフォルトの名無しさん
18/07/27 02:29:56.02 27BaLAkY.net
そもそも漢字や象形文字は、一種の絵文字だけどね。
569:デフォルトの名無しさん
18/07/27 02:40:46.86 1Fj2fl7C.net
そもそも論はどうでもいい
570:デフォルトの名無しさん
18/07/27 03:15:50.87 Wnb3i599.net
AJ16が出て結構経つとはいえこの間JISの改訂があったわけでもないんで
意外とAJ18も数十~数百文字程度の小規模アップデートで終わるかも
571:デフォルトの名無しさん
18/07/27 04:12:40.69 L9NPxvRK.net
元号が絵文字になるとVSによって色黒な昭和とか女性的な明治とかが生まれるのか
572:デフォルトの名無しさん
18/07/27 12:33:29.72 iHbYMqNW.net
元号なんて漢字2文字並べて書けばいいからそんな急ぐ必要無いだろ。
組み文字はUnicode13以降でもいいだろ。
573:デフォルトの名無しさん
18/07/27 17:48:33.71 27BaLAkY.net
大国であれ小国であれ、一国家の行政が絡んでいるという時点で、急ぐ必要があるんだよ。
なにしろ影響を受ける人の桁数が違う。
574:デフォルトの名無しさん
18/07/27 19:18:57.24 OorWiyDH.net
元号組文字なんか使ってる奴いるの?
575:デフォルトの名無しさん
18/07/27 19:32:41.17 VZghEMWS.net
役所やぞ
576:デフォルトの名無しさん
18/07/27 19:45:53.97 ZZpxf/7G.net
文字の名前もグリフも未定だけどとりあえずコードポイントだけ押さえましたなんて
Unicode史に残る珍事だと思うわ
577:デフォルトの名無しさん
18/07/27 19:56:54.08 Sut8d6Pq.net
影響を受けやすいような手段を一国家の行政が採用している無能さを棚に上げてるから駄目なんだ
578:デフォルトの名無しさん
18/07/27 20:31:49.16 27BaLAkY.net
「ワシは知らん」とUnicodeが無視した場合、本来は1ベンダーにすぎないマイクロソフトがそのしわ寄せに対応することになり、
結局、マイクロソフトの独自拡張をUnicodeがしぶしぶ追認することになるので二度手間なんだよ。
579:デフォルトの名無しさん
18/07/27 22:03:28.66 x//i6AWs.net
北朝鮮の将軍様専用ハングルとか数文字は国家規格に入ってるにも関わらず
未だにUnicodeに入れて貰えてないよな。
580:デフォルトの名無しさん
18/07/27 22:09:52.68 N1oOfHi2.net
元首の交代に伴って変更される紀年法をまだ使ってる国なんて他にあんのかね
581:デフォルトの名無しさん
18/07/27 23:53:13.41 G98hsmYh.net
まず無いだろうけど、もし新元号が現時点でUnicodeに無い漢字を使うものになったら
統合漢字のURO末端に緊急追加になるだろうな。
582:デフォルトの名無しさん
18/07/28 01:26:08.91 YvWIBfUX.net
>>566
その前に国内のシステムがおかしくなるよ。
常用漢字から選んでくれないと。
583:デフォルトの名無しさん
18/07/28 14:53:59.34 39ICzHjE.net
M明治
T対象
S昭和
H平成
A麻原
584:デフォルトの名無しさん
18/07/28 14:57:49.43 gid9j1yM.net
ゆぁ~えーびぃ~すぃ~ん♪
585:デフォルトの名無しさん
18/07/30 00:49:54.80 /AsJWau1.net
>>564
そういえばあれって三代目用の文字もあるのかな?
586:デフォルトの名無しさん
18/07/31 17:52:18.88 A7NyuH1x.net
将軍様専用ハングル以外にUnicode未収録文字は縞模様の三角とか謎の記号がいくつかあったな。
北朝鮮で使われてるRed Star OSではUnicodeが使われてるけどこれらはPUAに割り当てられてる。
因みにWindowsの北朝鮮版は無い。
>>570
2012年頃の改訂で追加されたらしい。
587:デフォルトの名無しさん
18/07/31 23:58:28.90 NbiBz0uu.net
新元号組み文字はJIS X0213には入れるのかな。
入れるとしたら㍻の1つ前の1面13区62点、シフトでJIS0x877D辺りか。
588:デフォルトの名無しさん
18/08/02 01:17:44.00 OU+qDqBT.net
専用ハングルはなんで「金」とか「日」とか重複する文字を代ごとに別々に入れてるのか謎
589:デフォルトの名無しさん
18/08/02 01:31:21.78 A1dOXp8b.net
>>573
謎か?
590:デフォルトの名無しさん
18/08/02 04:36:12.48 0KRWeg2T.net
最近の文字コードやばない?
591:デフォルトの名無しさん
18/08/02 08:45:58.28 XfZDNvg1.net
文字コードとしては謎だろ
担当は何をしているのか
指摘どころか質問した時点で解雇されるルールでもあるのかよってくらいに謎だわ
592:デフォルトの名無しさん
18/08/03 00:21:52.08 SeT2nEoR.net
やっぱおじいちゃんの金とおとうさんの正をを孫に使ったりしたら怒られるのかな。
グリフを見ただけで誰用の金なのかを見比べるスキルが必要になるんだろうな。
593:デフォルトの名無しさん
18/08/03 20:44:28.67 TC+4ZTQW.net
nkfコマンドってなにもオプション指定しないでも文字化け直してくれるんだなw
どうやってるのか知らなくて怖いが(普段はiconv(1)を使ってる)
594:デフォルトの名無しさん
18/08/04 01:43:06.83 i5vBNvJr.net
美乳
595:デフォルトの名無しさん
18/08/04 02:59:33.13 iDjKbl2c.net
>>579
今時EUC-jpが生きてるシステムってあるの?
596:デフォルトの名無しさん
18/08/04 04:56:17.77 iUNKVgUH.net
文字コードの自動判別は、100% 正確じゃない
間違うこともある
597:デフォルトの名無しさん
18/08/04 09:23:39.15 LcV/uUAN.net
bit 順に意味があるんだろうけど
"\xC8\xFE\xC6\xFD"
なんでこれで自動検出できるかの説明が欲しい
598:デフォルトの名無しさん
18/08/04 09:42:12.43 eMjkhZRT.net
〠
URLリンク(www.shtml.jp)
599:デフォルトの名無しさん
18/08/04 16:00:30.01 qslvxdhp.net
UnicodeはUCS-4を基本形にして
UTF-8はUCS-4の圧縮版のような扱いでいいんじゃないか
UCS-4ならCode Chartsに書かれている値をそのまま使うから分かりやすいし
UTF-16は廃止してもいいと思う
600:デフォルトの名無しさん
18/08/04 22:01:13.64 TFSU2vbY.net
わざわざ廃止とかデメリットしかない
601:デフォルトの名無しさん
18/08/04 22:35:16.02 sXotmGKy.net
WindowsのAPIがUTF-16ベースなのに廃止とか無理でしょ
602:デフォルトの名無しさん
18/08/04 23:38:59.79 Xh+3QD0k.net
pcre はutf8対応が不完全。無理もない話だけど。
文字コードのライブラリを作る人からすればutf8よりも、utf16やutf32の方が便利。
603:デフォルトの名無しさん
18/08/04 23:53:51.88 9dBFGr/9.net
そのutf-8の問題は utf-16でもutf-32でも同じなのでは
604:デフォルトの名無しさん
18/08/05 03:05:25.66 lHG7kQYc.net
seekがめんどくさいのがUTF-8の問題だと思うんだけど違うの?
605:デフォルトの名無しさん
18/08/05 03:36:24.64 oEhLV38F.net
UTF-16はUTF-8とUTF-32のデメリットを兼ね備えていて、
メリットが無いような気がする。
606:デフォルトの名無しさん
18/08/05 04:33:54.11 kXrZdLCy.net
このスレに来るような人が、どうしてutf8とutf16/32が同じと思うのか不思議。
自力で文字判定処理をやったことがないスクリプト言語プログラミング一辺倒の人?
607:デフォルトの名無しさん
18/08/05 08:22:11.27 RknsX4qY.net
>>591
文字コードに習熟したプログラマしかここに来ちゃいけないのかい?
俺みたいにユニコードとUTFの違いすらよくわからない者が情報を求めて
ここに通うこともあるんだぜ
608:デフォルトの名無しさん
18/08/05 08:42:30.75 kXrZdLCy.net
pythonなんて内部の文字コードutf16だよ。
使う側が意識せずに済んでるってのがむしろ凄いわけで。
utf16要らないとか言ってる人は、事業仕分けでドヤ顔する民主党議員だわ。
609:デフォルトの名無しさん
18/08/05 10:13:37.02 lHG7kQYc.net
仕分けしたからモリカケだけで済んでるんじゃないの?
610:デフォルトの名無しさん
18/08/05 12:03:49.97 LsZm/jJA.net
本当だよ
無駄な予算にかけようとするこういうバカは消えてほしい
611:デフォルトの名無しさん
18/08/05 14:46:05.09 mhm3uufJ.net
UTF-16はいきなり廃止するのは無理でも
新規設計非推奨くらいにはしてほしいよ
612:デフォルトの名無しさん
18/08/05 14:49:57.92 SfajzAT9.net
WinAPIでUTF-16使ってるから廃止は無理でしょ
613:デフォルトの名無しさん
18/08/05 15:00:37.79 mhm3uufJ.net
UTF-16は世界中の文字を固定長で表せるようにすることが目標だったから
16bitではそれができないと分かった以上32bitに変えるべき
614:デフォルトの名無しさん
18/08/05 20:42:38.42 kXrZdLCy.net
linux64bit版gccは、wchar_tやstd::wstringが既定でutf32だし、徐々に変わっていくでしょう。
615:デフォルトの名無しさん
18/08/06 11:54:02.02 wAAey1Ev.net
win32->win64のタイミングで変えとけばよかったのに
616:デフォルトの名無しさん
18/08/06 12:31:26.13 jTWGCXc0.net
もう一生UTF-16なのかな(´;ω;`)
617:デフォルトの名無しさん
18/08/06 15:04:26.69 9QlJsUMm.net
>>600
ほんそれ
ついでにシステムロケールもUTF8はよ
618:デフォルトの名無しさん
18/08/06 19:56:04.82 RHl3d08a.net
必要な時にUTF32を使えればいいだけなのでそんなに深刻がらなくても大丈夫でしょ。
619:デフォルトの名無しさん
18/08/06 20:28:33.56 JHbMXthk.net
基本は8で臨時は32で答えが出ているよなあ
日本独自のJIS関係とかもう要
620:らないし
621:デフォルトの名無しさん
18/08/06 21:09:19.10 J3hEGnZ9.net
そういえば新元号合字ってJIS X 0213とかCP932とかの系統にも入るのかな?
元号合字使ってるとこはUnicodeじゃない古いとこが多そうだからここに入れないと意味半減な気がするけど
622:デフォルトの名無しさん
18/08/06 21:18:55.92 RHl3d08a.net
印刷に使うワープロソフトはすべてunicode対応しているから大丈夫。
623:デフォルトの名無しさん
18/08/07 04:59:39.09 OlmXtX1U.net
JIS改訂汁
624:デフォルトの名無しさん
18/08/07 17:57:38.63 ym2n+lOO.net
日本語とか東アジア言語はバイト数の面では
UTF8よりUTF16の方が有利になるのだが。
625:デフォルトの名無しさん
18/08/07 18:02:30.52 pTM8y/Ns.net
そうでもない
626:デフォルトの名無しさん
18/08/07 19:58:16.46 4kVMfOQG.net
うむ
日本語などの2バイト圏でも8やで
627:デフォルトの名無しさん
18/08/07 21:15:40.62 FooseUHS.net
お経とかならそうかも
でも普通の日本語の文書はUTF-8で1バイトになる字がわりと使われてるよね
改行もバカにならない
628:デフォルトの名無しさん
18/08/07 21:38:24.37 d4J1pA0H.net
中国語ならUTF-16のほうが有利?
629:デフォルトの名無しさん
18/08/07 23:58:44.52 r6gcb8rL.net
エディタとかUTF-32に対応してないのが多いよな。
まあ、無駄が多いからな。最上位の1バイトは必ず0x00になるから。
630:デフォルトの名無しさん
18/08/08 00:28:20.77 rL4NvpAX.net
UTF-16は廃止してUTF-20を策定すべき
631:デフォルトの名無しさん
18/08/08 00:34:22.04 tqYMmDjs.net
UTF-24じゃないの
632:デフォルトの名無しさん
18/08/08 01:56:39.24 00np0Lo5.net
ランダムアクセスが一番早い文字コードはどれよ
633:デフォルトの名無しさん
18/08/08 02:09:19.94 kZ99Qrjg.net
余ってる場所を余計なことに使う奴が絶対出てきて、
それを根絶するのに凄い辛い思いをするからヤメレ。
634:デフォルトの名無しさん
18/08/08 04:24:19.86 tqYMmDjs.net
もうこれ人類的に根絶できないんだろうね
一生これなんだろうね
635:デフォルトの名無しさん
18/08/08 04:37:42.38 XhOfYtOw.net
>>615
utf8でいいよ
636:デフォルトの名無しさん
18/08/08 08:35:31.20 /x3y+p/o.net
そういえば、utf9というのもあったな。36ビットコンピュータに最適だとか。
637:デフォルトの名無しさん
18/08/08 14:09:08.17 QoUOzAqb.net
UTF-7と言う変態も
638:デフォルトの名無しさん
18/08/08 16:40:51.17 QemCzjVB.net
Base64
639:デフォルトの名無しさん
18/08/08 18:02:57.82 SZpNbR5J.net
UTF-24を策定するべきだな。
全ての文字を24ビット(3バイト)で表す。
UTF-32の0x00で固定な最上位バイトを省くというので。
BMP外の文字だらけの文章には有利になるだろう。
640:デフォルトの名無しさん
18/08/08 22:53:07.77 jNIJWXgx.net
>>623
だな、固定長はUTF-24、可変長はUTF-8でいいだろう
641:デフォルトの名無しさん
18/08/08 23:15:02.85 oJrY5QK4.net
UTF16はいらないとかUTF24がよいとか、変な書き込みする人、同一人物?
CPUのレジスタは32bitまたは64bitなので、1バイトをコピーするのも4バイトをコピーするのも時間コストは同じだよ。
642:デフォルトの名無しさん
18/08/08 23:48:28.49 EMFNgHK2.net
1バイトと4バイトとかミクロの性能比較なんか殆ど意味無い
643:デフォルトの名無しさん
18/08/08 23:49:21.32 SCPSjdZ4.net
固定長だなんて幻想をまだ見てるの?
644:デフォルトの名無しさん
18/08/08 23:50:49.11 7IOaw32y.net
固定長の方が高速で便利ですやん
645:デフォルトの名無しさん
18/08/08 23:57:42.55 oJrY5QK4.net
>>626
大ありですよ。
>>627
固定長の方が条件分岐が減るので処理速度が高く、プログラミングもしやすい。
646:デフォルトの名無しさん
18/08/09 01:13:33.46 BF3jeRnZ.net
>>626
ファイルサイズがでかくなればそれだけ処理をする回数が増えるからダイレクトに効いてくる。